Annuncio di **Meta AI Research** pubblicato il **5 agosto 2026** (tempo di lettura indicato: 4 minuti, nessuna firma individuale): **Muse Code** in beta, *« un agente di coding da terminale »*, e il modello che lo alimenta, **Muse Spark 1.2**. È Meta stessa a inquadrare il lancio: *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Tre elementi architetturali sul lato harness.** **Agenti asincroni in background** che *« remain active throughout each session, rather than being spawned for individual tasks »*, evitando raccolte di informazioni ridondanti e riducendo la necessità di guida manuale. Un **registro eventi locale** dove *« every model call, tool run, approval, and edit is appended »*, che rende il runtime un sistema *« replay-exact and restart-safe »*, capace di riprendere esattamente da dove si era interrotto dopo un crash. E **tre skill fornite di serie**: `/plan` (trasforma un compito in un piano sottoposto ad approvazione), **`/grill`** (mette alla prova il piano *« until it holds up »*), e `/goal`. **Sul lato modello**, Meta rivendica il **co-training modello-harness** (*« to maximize harness compatibility »*, con traiettorie di harness campionate tramite rejection sampling e ottimizzazioni delle ricette per obiettivi, compaction e sub-agenti), un addestramento **long-horizon** (generazione dell'intero repository, progetti end-to-end, self-research, con pianificazione, goal conditioning e compaction del contesto), e un **ciclo di auto-miglioramento** in cui Muse Spark 1.1 genera gli ambienti e i template di istruzioni e poi valuta le soluzioni candidate, producendo un set di addestramento per la 1.2. **Ciò che mostrano i grafici pubblicati**, senza che il testo li commenti: i quattro confronti — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno Meta e il case study di ottimizzazione di kernel GPU — collocano **Muse Spark 1.2 dietro Opus 5 in tutti e quattro i casi**, incluso sul benchmark proprietario di Meta stessa (70,6% contro 79,4%) e sul case study, dove il modello si classifica quarto su sei (+68,7% contro +74,0%). **Un'avvertenza di lettura sul guadagno di versione**: sui due benchmark pubblici, la 1.1 è misurata con `mini-swe-agent` e la 1.2 con Muse Code, per cui lo scarto di 6,7 punti confonde progresso del modello e progresso dell'harness. Sul benchmark interno, l'unico confronto in cui non viene menzionato alcun harness, lo scarto 1.1 → 1.2 scende a **2,3 punti**.
#Meta AI Research#Muse Code#Muse Spark 1.2
**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.
Voce **Skill**: **hyperresearch** di **Jordan Gibbs** è un **harness di ricerca approfondita** che trasforma Claude Code in un agente di ricerca documentale, distribuito come pacchetto PyPI (MIT, Python 3.11-3.13) che installa **20 skill Claude Code**, una CLI, un server MCP e una UI web locale. Osservato il **3 agosto 2026**: 1.568 stelle, 170 fork, repository creato il 9 aprile 2026, ultimo push il 1° agosto. **Il nucleo è una pipeline a 16 passaggi adattiva per livelli (tier)** — `light` (~30-40 min), `full` (~1,5-2,5 h), `dissertation` (4-8 h, da 25.000 a 80.000 parole su 300-450 fonti) — che prende un prompt e restituisce un report sottoposto ad audit avversariale con provenienza completa. **La decisione architetturale centrale è documentata insieme al suo modo di fallimento**: la skill d'ingresso è un **router leggero (thin router)** senza procedura propria, ogni passaggio vive nella propria skill caricata **fresca al momento dell'invocazione**, perché la versione precedente era *« una singola skill di 1200 righe che veniva compattata via prima che il Layer 4 avesse bisogno della sua procedura di triplo abbozzo. L'orchestratore ha dimenticato la procedura, ha scritto un'unica bozza e ha prodotto un report dal punteggio piatto. »* **Due principi portanti.** *« Patch, mai rigenerare »*: dopo la sintesi, sono possibili solo ritocchi chirurgici con `Edit`, con il patcher e l'auditor di rifinitura bloccati sugli strumenti (`tool-locked`) a `[Read, Edit]` a livello di allowlist di Claude Code, in modo che *« non possano fisicamente scrivere (Write) una nuova bozza »*. *« La query di ricerca canonica è vangelo »*: il prompt testuale viene salvato una sola volta in `query.md` e riletto da ogni passaggio e da ogni subagente. **Sedici subagenti** con ruolo e modello configurabili (i fetcher e il cite-checker su Sonnet, i critici, il synthesizer e il patcher su Opus). **Il vault** è un archivio markdown persistente indicizzato in SQLite — *« Markdown è la verità, SQLite è la cache »* — con un ciclo di vita delle note (`draft → review → evergreen`, `stale → deprecated → archive`), provenienza tracciabile, un punteggio di qualità composito (tipo di fonte, autorità citazionale tramite OpenAlex e Semantic Scholar con segnalazioni di ritrattazione, PageRank interno), e un **audit di indipendenza** che raggruppa le copie sindacate — *« cinque ristampe di uno stesso comunicato stampa pesano quanto un'unica fonte »*. **Tre gate meccanici prima della pubblicazione**: l'integrità delle citazioni (ogni citazione riportata deve esistere **testualmente** in una nota del vault), una scansione delle ritrattazioni aggiornata su ogni DOI citato, e una verifica del collegamento citazione-frase da parte di un LLM scettico. **Riserva da segnalare**: l'affermazione d'apertura — *« attualmente in testa alla classifica DeepResearch-Bench RACE »* — è contraddetta dalla propria stessa nota a piè di pagina, *« proiezione prospettica da un pilota stratificato… la convalida da parte di terzi è in sospeso »*. Una proiezione non è una classifica, eppure il grafico la colloca davanti a Gemini e OpenAI Deep Research.
#skill#ricerca approfondita#harness di ricerca
**Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** (`pip install hyperresearch`). Signaux d'adoption au 3 août 2026 : **1 568 étoiles** · **170 forks** · 13 issues ouvertes · dépôt créé le **9 avril 2026** et poussé le **1er août 2026** — soit une traction rapide sur moins de quatre mois. Topics déclarés : `agents` · `agentskills` · `claude-code` · `deep-research` · `deep-research-agent`.