Anuncio de Meta AI Research fechado el 5 de agosto de 2026: Muse Code en beta, un agente de codificación de terminal, y Muse Spark 1.2, el modelo que lo impulsa. La propia Meta enmarca el lanzamiento —« nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir ».
Del lado del harness, tres decisiones. Agentes asíncronos en segundo plano que « permanecen activos durante toda la sesión, en lugar de generarse para tareas individuales », evitando la recopilación redundante de información y decidiendo por sí mismos cuándo escalar al agente principal. Un registro de eventos local que registra cada llamada al modelo, ejecución de herramienta, aprobación y edición, lo que hace que el runtime sea « exacto en la reproducción y seguro ante reinicios »: tras un fallo, el agente reanuda exactamente donde se quedó. Y tres skills incluidas de fábrica: /plan (un plan sometido a aprobación), /grill (somete el plan a prueba de estrés hasta que se sostiene), y /goal.
Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir.
Del lado del modelo, Meta reivindica co-entrenamiento con el harness « para maximizar la compatibilidad con el harness », entrenamiento de largo horizonte (repositorio completo, proyectos de principio a fin, autoinvestigación, compactación de contexto), y un bucle de auto-mejora en el que la versión 1.1 genera los entornos y califica las soluciones, produciendo el conjunto de entrenamiento para la 1.2.
El hecho central de este anuncio no se menciona en ninguna parte de su texto. Las cuatro comparaciones publicadas existen solo como imágenes, y sitúan a Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos: 82,9 % frente a 86,7 % en Terminal-Bench 2.1, 59,3 % frente a 65,0 % en DeepSWE 1.1, 70,6 % frente a 79,4 % en el propio benchmark interno de Meta, y +68,7 % frente a +74,0 % en el estudio de caso de optimización de kernels GPU, donde el modelo termina cuarto de seis, por detrás de GPT 5.6 Sol y por detrás de la generación anterior de Anthropic.
Y la ganancia propia del modelo es menor de lo que parece. En los dos benchmarks públicos, la versión 1.1 se evalúa con mini-swe-agent y la 1.2 con Muse Code: la diferencia de 6,7 puntos mezcla modelo y harness. En el benchmark interno, la única comparación sin harness indicado, cae a 2,3 puntos.
El anuncio se sostiene por tanto principalmente como confirmación empírica de una tesis ya planteada: el valor se está desplazando hacia el harness, y un harness co-entrenado con sus propios pesos hace que esos pesos sean aún más no intercambiables.