# meta-muse-code-muse-spark-1-2-2026-08-05

## Veille

Anuncio de **Meta AI Research** publicado el **5 de agosto de 2026** (tiempo de lectura indicado: 4 minutos, sin firma individual): **Muse Code** en beta, *« un agente de codificación de terminal »*, y el modelo que lo impulsa, **Muse Spark 1.2**. La propia Meta enmarca el lanzamiento: *« Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir. »* **Tres elementos arquitectónicos del lado del harness.** **Agentes asíncronos en segundo plano** que *« permanecen activos durante toda la sesión, en lugar de generarse para tareas individuales »*, evitando la recopilación redundante de información y reduciendo la necesidad de dirección. Un **registro de eventos local** donde *« se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición »*, lo que convierte el runtime en un sistema que es *« exacto en la reproducción (replay-exact) y seguro ante reinicios (restart-safe) »*, capaz de reanudar exactamente donde se quedó tras un fallo. Y **tres skills incluidas de fábrica**: `/plan` (convierte una tarea en un plan sometido a aprobación), **`/grill`** (somete el plan a prueba de estrés *« hasta que se sostenga »*), y `/goal`. **Del lado del modelo**, Meta reivindica **co-entrenamiento modelo-harness** (*« para maximizar la compatibilidad con el harness »*, con trayectorias de harness muestreadas mediante rejection sampling y optimizaciones de receta para objetivos, compactación y sub-agentes), entrenamiento de **largo horizonte** (generación de repositorios completos, proyectos de principio a fin, autoinvestigación, con planificación, condicionamiento por objetivo y compactación de contexto), y un **bucle de auto-mejora** en el que Muse Spark 1.1 genera los entornos y las plantillas de instrucciones y luego califica las soluciones candidatas, produciendo un conjunto de entrenamiento para la 1.2. **Lo que muestran los gráficos publicados**, sin que el texto lo comente: las cuatro comparaciones —Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno de Meta y el estudio de caso de optimización de kernels GPU— sitúan a **Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos**, incluido en el propio benchmark propietario de Meta (70,6 % frente a 79,4 %) y en el estudio de caso, donde el modelo termina cuarto de seis (+68,7 % frente a +74,0 %). **Una advertencia de lectura sobre la ganancia entre versiones**: en los dos benchmarks públicos, la 1.1 se mide con `mini-swe-agent` y la 1.2 con Muse Code, por lo que la diferencia de 6,7 puntos mezcla progreso del modelo y progreso del harness. En el benchmark interno, la única comparación en la que no se menciona ningún harness, la diferencia 1.1 → 1.2 cae a **2,3 puntos**.

## Titre Article

Introducing Muse Code and Muse Spark 1.2

## Date

2026-08-05

## URL

https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

## Keywords

Meta AI Research, Muse Code, Muse Spark 1.2, agente de codificación de terminal, beta, harness, agentes asíncronos en segundo plano, sub-agentes persistentes, recopilación redundante de información, registro de eventos, registro de eventos, exacto en la reproducción, seguro ante reinicios, recuperación tras fallo, tareas de larga duración, skills incluidas, plan aprobado, grill, goal, co-entrenamiento modelo-harness, rejection sampling, trayectorias de harness, compatibilidad con el harness, largo horizonte, generación de repositorio completo, autoinvestigación, condicionamiento por objetivo, compactación de contexto, auto-mejora, generación de entornos, calificación de soluciones, Terminal-Bench 2.1, DeepSWE 1.1, benchmark interno, Opus 5, Claude Code, GPT 5.6 Terra, GPT 5.6 Sol, Codex, Grok 4.5, Gemini 3.6 Flash, Antigravity CLI, mini-swe-agent, optimización de kernels GPU, Triton, KDA, MLA, NVIDIA Hopper, llamadas acumuladas a herramientas, aceleración frente a línea base, FLA, fusión de kernels, tiling, Meta Model API, lock-in mediante optimización

## Authors

**Meta AI Research** — publication institutionnelle sans auteur nommé, sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation, non repris ici.

**Positionnement à connaître** : Meta arrive sur le terrain de l'agent de codage en terminal **après** Claude Code, Codex, Gemini CLI, Grok Build et Antigravity CLI, et le dit — *« our next step toward the frontier »*. L'annonce couple un **produit** (Muse Code, distribué par `curl … | bash`) et un **modèle** (Muse Spark 1.2, disponible dans Muse Code et dans **Meta Model API** avec *« expanded global access »*), les deux ayant été entraînés ensemble.

## Ton

**Perfil**: un anuncio de producto de laboratorio de investigación, formato breve, registro técnico sobrio. Sin hipérbole, sin reivindicación de superioridad, sin superlativos — algo **inusual para un lanzamiento** y que resulta en sí mismo informativo.

**Estilo**: el texto avanza **describiendo mecanismos**, sección por sección, cada una un único párrafo que nombra una decisión de ingeniería concreta — persistencia de sub-agentes, el registro de eventos, el co-entrenamiento, la compactación. No hay caso de cliente, ni cita ejecutiva, ni promesa de productividad. La única demostración narrativa es una viñeta: un usuario suelta en la terminal un vídeo de recorrido de una casa en `mp4`, Muse Code lo interpreta, y produce una página de reserva de alquiler de corta duración.

**El rasgo más notable es la modestia del encuadre**, planteada ya desde la segunda frase: *« Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir. »* Meta anuncia un hito y señala que lo mejor está por llegar. La conclusión repite la misma postura: *« Tenemos mucho en el horizonte, incluidas nuevas funciones de harness y modelos más potentes. »*

**Esta modestia se confirma en los gráficos**, y es lo que hace distintivo al anuncio: Meta publica cuatro comparaciones en las que nunca gana. Pocos lanzamientos están dispuestos a mostrar a un competidor en cabeza en su propia página — y menos aún en su **propio benchmark interno**.

**Frases marcadoras**: *« nuestro siguiente paso hacia la frontera »*, *« en lugar de generarse para tareas individuales »*, *« exacto en la reproducción y seguro ante reinicios »*, *« /grill somete ese plan a prueba de estrés hasta que se sostiene »*, *« para maximizar la compatibilidad con el harness »*.

## Pense-betes

- **Fecha / fuente**: **5 de agosto de 2026**, Meta AI Research, anuncio sin firma. **Muse Code** (beta), un agente de codificación de terminal instalado mediante `curl -fsSL https://dev.meta.ai/install.sh | bash` en macOS y Linux, y **Muse Spark 1.2**, disponible en Muse Code y en Meta Model API.
- **Encuadre clave**: no aparece ninguna cifra en el texto — las cuatro comparaciones son imágenes ráster. Los valores siguientes se leyeron visualmente en los PNG. ### Las cuatro comparaciones | Comparación | Ganador | Muse Spark 1.2 | Posición | |---|---|---|---| | Terminal-Bench 2.1 | Opus 5 + Claude Code — **86,7 %** | 82,9 % | 2.º / 6 | | DeepSWE 1.1 | Opus 5 + Claude Code — **65,0 %** | 59,3 % | 3.º / 6 | | **Meta Internal Coding Bench** | Opus 5 — **79,4 %** | 70,6 % | 2.º / 5 | | Estudio de caso KDA (speedup) | Opus 5 — **+74,0 %** | +68,7 % | **4.º / 6** | En su propio benchmark propietario, Meta queda 8,8 puntos por detrás de Opus 5; en el estudio de caso elegido como vitrina, también queda por detrás de GPT 5.6 Sol (+71,2 %) y de la generación anterior de Anthropic, Opus 4.8 (+69,6 %). ### La ganancia del modelo es menor de lo que se muestra En Terminal-Bench y DeepSWE, la 1.1 se evalúa con **`mini-swe-agent`** y la 1.2 con **Muse Code**: la diferencia mostrada (76,2 → 82,9, es decir **+6,7 puntos**) mezcla el progreso del modelo y el progreso del harness. En el benchmark interno, la única tabla en la que no se indica ningún harness, la diferencia 1.1 → 1.2 cae a **68,3 → 70,6, es decir +2,3 puntos**. Ninguna de estas comparaciones es modelo contra modelo: son pares **modelo + harness**, cada modelo medido con el harness de su propio laboratorio. Esto valida empíricamente, con tres semanas de diferencia, el mecanismo descrito por [[mozilla-state-of-open-source-ai-2026-07]] — *« un harness ajustado estrechamente a los pesos de un laboratorio se convierte en un componente integrado del producto de ese laboratorio… El lock-in llega como efecto secundario de la optimización »* — al declarar Meta explícitamente que co-entrenó el modelo con el harness *« para maximizar la compatibilidad con el harness »*. ### El registro de eventos *« Un registro de eventos local en el que se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición »*, una única fuente de verdad que hace que el runtime sea *« exacto en la reproducción y seguro ante reinicios »*: tras un fallo, el agente reanuda exactamente donde se quedó, lo que permite tareas de larga duración. Una convergencia directa con el manifiesto de ejecución y el comando `run resume` de [[skill-gibbs-hyperresearch-2026-08-03]]. Dos equipos independientes llegan al mismo diseño: el contexto no sobrevive, un registro en disco sí. ### Agentes persistentes en segundo plano En lugar de generarse para una tarea y luego destruirse, *« permanecen activos durante toda la sesión »*, lo que evita *« la recopilación redundante de información »*, les permite decidir por sí mismos cuándo escalar al agente principal, y reduce *« la latencia y la necesidad de dirección »*. Merece contrastarse con la observación opuesta de [[lassiege-usine-logicielle-heure-ia-2026-07-28]] sobre los sub-agentes desechables (*« los uso cada vez menos »*): dos respuestas opuestas al mismo problema — delegar menos, o delegar en agentes que ya no mueren. ### Las tres skills incluidas `/plan` (un plan **sometido a aprobación**), **`/grill`** (*« somete ese plan a prueba de estrés hasta que se sostiene »*), `/goal`. El bucle descrito es **plan → cuestionamiento → ejecución** con una puerta humana en el primer paso. `/grill` recoge la función de una skill comunitaria ya documentada: un patrón nacido en la comunidad llega preinstalado en un laboratorio de frontera. ### Auto-mejora, leída con precisión *« También usamos Muse Spark 1.1 para generar entornos de codificación exigentes y plantillas de seguimiento de instrucciones. El modelo luego calificó las soluciones candidatas… produciendo un conjunto de datos de entrenamiento escalable para Muse Spark 1.2. »* Es la **1.1** la que genera los entornos y realiza la calificación, siendo la 1.2 el producto de ese conjunto de datos — el sujeto de *« el modelo »* es ambiguo, y alguna cobertura lo ha leído como la 1.2. Un bucle de destilación de una generación sobre sí misma, cuya limitación conocida es que solo puede enseñar lo que la generación anterior ya sabe evaluar. ### Estudio de caso de kernels GPU: el protocolo vale más que el resultado Optimización iterativa a lo largo de **más de 1.000 llamadas acumuladas a herramientas, hasta 24 horas**, en los kernels **KDA** y **MLA** para GPU NVIDIA Hopper; el modelo escribe, compila, perfila y mejora. Una restricción notable: *« Se prohibió a los modelos importar directamente bibliotecas de kernels de terceros como FLA »* — el algoritmo tuvo que reimplementarse en Triton, no envolverse alrededor de una implementación existente. Esto es lo que hace honesta la prueba. En KDA: un kernel de preparación paralelo por bloques más un escaneo secuencial entre bloques, con la decadencia acumulada recentrada en el punto medio del bloque. En MLA: un pipeline Triton de dos kernels que reutiliza el latente KV compartido como K y V, medido con tamaño de lote 1, 64 cabezas, longitud de secuencia 8.192, dimensión latente 512. **KDA es la atención lineal de Kimi**: Meta hace así que su agente optimice el kernel de una arquitectura competidora de pesos abiertos. ### Tres advertencias metodológicas sobre los gráficos 1. **Sin cifras en el texto**: imágenes ráster sin datos de texto y sin etiqueta numérica de accesibilidad. Un agregador, o un agente que lea la página, no ve ningún resultado en absoluto. 2. **El eje Y del gráfico de KDA es no lineal**, algo que Meta revela honestamente (*« Axis Spaced Linearly In X »*, marcas en 0-27-43-53-60-65-69-72-75 %). La escala estira el rango superior e infla visualmente las diferencias entre los modelos de cabeza — en detrimento de Meta. 3. **Las configuraciones comparadas no son uniformes**: `max` para Opus 5 y GPT 5.6 Terra, `high` para Grok 4.5 y Gemini 3.6 Flash, nada para Muse Spark. Grok está ausente del benchmark interno, GPT 5.6 Sol solo aparece en el estudio de caso: la composición del panel cambia de un gráfico a otro. El *« Meta Internal Coding Bench »* no es público y su composición no se describe; Meta mide en él a sus competidores. El hecho de que pierda ahí hace la cifra más creíble que una puntuación halagadora, pero un benchmark propietario sigue siendo no reproducible. ### Lo que el anuncio no dice Ningún precio, ningún límite de uso, ninguna licencia de modelo, ninguna apertura de pesos — una ruptura notable con la tradición Llama, sobre la que la publicación guarda silencio. Tampoco nada sobre los idiomas soportados, el tamaño del contexto, ni las garantías de confidencialidad para el código enviado.

## RésuméDe400mots

Anuncio de **Meta AI Research** fechado el **5 de agosto de 2026**: **Muse Code** en beta, un agente de codificación de terminal, y **Muse Spark 1.2**, el modelo que lo impulsa. La propia Meta enmarca el lanzamiento —*« nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir »*.

**Del lado del harness, tres decisiones.** **Agentes asíncronos en segundo plano** que *« permanecen activos durante toda la sesión, en lugar de generarse para tareas individuales »*, evitando la recopilación redundante de información y decidiendo por sí mismos cuándo escalar al agente principal. Un **registro de eventos local** que registra cada llamada al modelo, ejecución de herramienta, aprobación y edición, lo que hace que el runtime sea *« exacto en la reproducción y seguro ante reinicios »*: tras un fallo, el agente reanuda exactamente donde se quedó. Y tres **skills incluidas de fábrica**: `/plan` (un plan sometido a aprobación), **`/grill`** (somete el plan a prueba de estrés hasta que se sostiene), y `/goal`.

**Del lado del modelo**, Meta reivindica **co-entrenamiento con el harness** *« para maximizar la compatibilidad con el harness »*, entrenamiento de largo horizonte (repositorio completo, proyectos de principio a fin, autoinvestigación, compactación de contexto), y un bucle de auto-mejora en el que la versión 1.1 genera los entornos y califica las soluciones, produciendo el conjunto de entrenamiento para la 1.2.

**El hecho central de este anuncio no se menciona en ninguna parte de su texto.** Las cuatro comparaciones publicadas existen solo como imágenes, y sitúan a Muse Spark 1.2 **por detrás de Opus 5 en los cuatro casos**: 82,9 % frente a 86,7 % en Terminal-Bench 2.1, 59,3 % frente a 65,0 % en DeepSWE 1.1, **70,6 % frente a 79,4 % en el propio benchmark interno de Meta**, y +68,7 % frente a +74,0 % en el estudio de caso de optimización de kernels GPU, donde el modelo termina **cuarto de seis**, por detrás de GPT 5.6 Sol y por detrás de la generación anterior de Anthropic.

**Y la ganancia propia del modelo es menor de lo que parece.** En los dos benchmarks públicos, la versión 1.1 se evalúa con `mini-swe-agent` y la 1.2 con Muse Code: la diferencia de 6,7 puntos mezcla modelo y harness. En el benchmark interno, la única comparación sin harness indicado, cae a **2,3 puntos**.

El anuncio se sostiene por tanto principalmente como **confirmación empírica** de una tesis ya planteada: el valor se está desplazando hacia el harness, y un harness co-entrenado con sus propios pesos hace que esos pesos sean aún más no intercambiables.

## GrapheDeConnaissance

- Meta AI Research —publie→ Muse Code (TECHNOLOGIE, 0.97)
- Meta AI Research —publie→ Muse Spark 1.2 (TECHNOLOGIE, 0.97)
- Muse Spark 1.2 —est_variante_de→ Muse Spark 1.1 (TECHNOLOGIE, 0.95)
- Muse Code —utilise→ Muse Spark 1.2 (TECHNOLOGIE, 0.96)
- Muse Spark 1.2 —est_basé_sur→ un co-entraînement avec le harnais Muse Code pour maximiser leur compatibilité (AFFIRMATION, 0.95)
- co-entraînement d'un modèle avec son harnais —réduit→ l'interchangeabilité des poids sous-jacents (AFFIRMATION, 0.85)
- journal d'événements local —permet→ de reprendre exactement où l'agent s'est arrêté après un plantage (AFFIRMATION, 0.95)
- agents d'arrière-plan persistants —s_oppose_à→ les sous-agents créés puis détruits pour chaque tâche (AFFIRMATION, 0.94)
- agents d'arrière-plan persistants —réduit→ la collecte d'information redondante et le besoin de pilotage (AFFIRMATION, 0.93)
- Muse Code —utilise→ une skill de mise à l'épreuve du plan avant implémentation (AFFIRMATION, 0.93)
- Muse Spark 1.1 —permet→ de générer les environnements et de noter les solutions ayant servi à entraîner Muse Spark 1.2 (AFFIRMATION, 0.9)
- Opus 5 —surpasse→ Muse Spark 1.2 (TECHNOLOGIE, 0.95)
- Muse Spark 1.2 —mesure→ 82,9 % sur Terminal-Bench 2.1 contre 86,7 % pour Opus 5 avec Claude Code (MESURE, 0.93)
- Muse Spark 1.2 —mesure→ 59,3 % sur DeepSWE 1.1 contre 65,0 % pour Opus 5 et 64,8 % pour GPT 5.6 Terra (MESURE, 0.93)
- Muse Spark 1.2 —mesure→ 70,6 % sur le benchmark interne de Meta contre 79,4 % pour Opus 5 (MESURE, 0.92)
- Muse Spark 1.2 —mesure→ une accélération de noyau KDA de +68,7 %, quatrième derrière Opus 5, GPT 5.6 Sol et Opus 4.8 (MESURE, 0.92)
- comparaison de paires modèle et harnais —s_oppose_à→ une comparaison de modèles isolés, les deux benchmarks publics évaluant chaque modèle avec le harnais de son laboratoire (AFFIRMATION, 0.9)
- gain entre versions —mesure→ 2,3 points sur le seul comparatif sans harnais indiqué, contre 6,7 points sur les comparatifs avec harnais (MESURE, 0.88)
- Muse Code —s_applique_à→ l'optimisation itérative de noyaux GPU sur plus de 1 000 appels d'outils et jusqu'à 24 heures (AFFIRMATION, 0.93)
- interdiction d'importer une bibliothèque de noyaux tierce —permet→ de tester la réimplémentation d'un algorithme plutôt que l'enveloppement d'une implémentation existante (AFFIRMATION, 0.92)
- Meta AI Research —affirme_que→ ce lancement est une étape vers la frontière, des modèles plus grands et plus capables étant à venir (CITATION, 0.95)
- benchmarks publiés uniquement en image —s_oppose_à→ la lisibilité des résultats par un agrégateur ou un agent lisant la page (AFFIRMATION, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/meta-muse-code-muse-spark-1-2-2026-08-05/
