Vai al contenuto

root / tags / harnais

#harnais

5 fiches

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Introducing Muse Code and Muse Spark 1.2

Annuncio di **Meta AI Research** pubblicato il **5 agosto 2026** (tempo di lettura indicato: 4 minuti, nessuna firma individuale): **Muse Code** in beta, *« un agente di coding da terminale »*, e il modello che lo alimenta, **Muse Spark 1.2**. È Meta stessa a inquadrare il lancio: *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Tre elementi architetturali sul lato harness.** **Agenti asincroni in background** che *« remain active throughout each session, rather than being spawned for individual tasks »*, evitando raccolte di informazioni ridondanti e riducendo la necessità di guida manuale. Un **registro eventi locale** dove *« every model call, tool run, approval, and edit is appended »*, che rende il runtime un sistema *« replay-exact and restart-safe »*, capace di riprendere esattamente da dove si era interrotto dopo un crash. E **tre skill fornite di serie**: `/plan` (trasforma un compito in un piano sottoposto ad approvazione), **`/grill`** (mette alla prova il piano *« until it holds up »*), e `/goal`. **Sul lato modello**, Meta rivendica il **co-training modello-harness** (*« to maximize harness compatibility »*, con traiettorie di harness campionate tramite rejection sampling e ottimizzazioni delle ricette per obiettivi, compaction e sub-agenti), un addestramento **long-horizon** (generazione dell'intero repository, progetti end-to-end, self-research, con pianificazione, goal conditioning e compaction del contesto), e un **ciclo di auto-miglioramento** in cui Muse Spark 1.1 genera gli ambienti e i template di istruzioni e poi valuta le soluzioni candidate, producendo un set di addestramento per la 1.2. **Ciò che mostrano i grafici pubblicati**, senza che il testo li commenti: i quattro confronti — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno Meta e il case study di ottimizzazione di kernel GPU — collocano **Muse Spark 1.2 dietro Opus 5 in tutti e quattro i casi**, incluso sul benchmark proprietario di Meta stessa (70,6% contro 79,4%) e sul case study, dove il modello si classifica quarto su sei (+68,7% contro +74,0%). **Un'avvertenza di lettura sul guadagno di versione**: sui due benchmark pubblici, la 1.1 è misurata con `mini-swe-agent` e la 1.2 con Muse Code, per cui lo scarto di 6,7 punti confonde progresso del modello e progresso dell'harness. Sul benchmark interno, l'unico confronto in cui non viene menzionato alcun harness, lo scarto 1.1 → 1.2 scende a **2,3 punti**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

ACP : deux protocoles, un sigle, zéro rapport

Nota di veglia tecnologica di **Didier Girard** datata **2 agosto 2026**, nata dalla domanda di un collega ("cos'è ACP?") per affrontare un problema che non è terminologico ma **documentario**. **Tre protocolli si contendono l'acronimo**, senza alcuna sovrapposizione tecnica: **Agent Client Protocol** (client ↔ agente — Zed, agosto 2025, JSON-RPC 2.0 su stdio, Apache-2.0, "ciò che LSP ha fatto per i linguaggi"), **Agentic Commerce Protocol** (agente ↔ commerciante — OpenAI + Stripe, 29 settembre 2025, in concorrenza con l'**UCP** di Google dell'11 gennaio 2026 sostenuto da **AP2**), e **Agent Communication Protocol** (agente ↔ agente — IBM Research / BeeAI, marginale ma che inquina le ricerche). **Il cuore della nota non è lo scioglimento dell'ambiguità ma il suo fallimento osservato**: l'autore cerca "ACP" nella propria base di conoscenza di veglia tecnologica e ottiene **dodici risultati, tutti relativi al protocollo di commercio, zero su quello di Zed** — *"i nostri agenti di veglia avevano indicizzato l'acronimo senza disambiguarlo"*. Da qui una regola di ingegneria della conoscenza: ***"un acronimo nudo non viene mai indicizzato"*** — l'entità è "Agent Client Protocol", "ACP" è **solo un alias**, portato da tre entità distinte. Segue una precisazione strutturante (**MCP collega un agente ai suoi strumenti, ACP collega un client a un agente; i due si sovrappongono**), poi il caso di scuola: **Buzz**, pubblicato da **Block** il 21 luglio 2026 sotto Apache-2.0 — uno spazio di lavoro auto-ospitabile costruito su **Nostr**, dove ogni partecipante umano o agente è una **coppia di chiavi** e ogni messaggio, passo di workflow o git push è un **evento firmato** in un log append-only. Un'architettura interamente basata su protocolli (`buzz-acp` un harness ACP su stdio, `buzz-agent` un agente ACP che chiama un LLM, `buzz-dev-mcp` un server shell + editing MCP), da cui l'agnosticismo verso gli agenti: **Goose, Claude Code e Codex** si collegano tramite lo stesso harness, e **Hermes** (Nous Research) vi si è collegato senza che Block scrivesse una sola riga — *"N+M invece di N×M, in produzione"*. La nota si chiude sulla questione dell'**abbonamento Claude** rispetto agli agenti terzi, con una cronologia in cinque tappe per il 2026 e una **regola di design** che vale oltre questo caso: la linea di demarcazione non è legale ma **architetturale** — ***"chi consuma, e per conto di chi"*** (un agente `owner-only` consuma il tuo abbonamento per tuo conto; un agente `anyone` in un canale condiviso instrada le richieste dei tuoi colleghi attraverso il tuo account). **Verifica effettuata su questo corpus**: la tesi regge, e in modo più netto di quanto affermi la nota — non solo "Agent Client Protocol" è **completamente assente**, ma l'acronimo nudo `ACP` **è già tipizzato come entità** in due schede, e la pagina della KB `Agentic-Commerce-Protocol` **attribuisce già il protocollo a Google** quando invece appartiene a OpenAI + Stripe. La collisione descritta non è un rischio futuro: ha **già prodotto un errore di attribuzione** nel grafo.

#ACP#Agent Client Protocol#Agentic Commerce Protocol

**Didier Girard** — auteur de la note. Écrit ici depuis la position de **praticien de la veille outillée** : le déclencheur est une question de collègue · le matériau principal est le comportement observé de sa propre base de connaissances · et la conclusion est une **règle de curation** adoptée en interne. Le texte alterne donc deux voix — l'explicateur de protocoles et l'ingénieur de la connaissance qui constate un défaut chez lui et en tire une norme.

Qualità e Sicurezza Traduzione verificata automaticamente

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Episodio "Fase 5 · Review" della serie SFEIR sul SDLC aumentato, pubblicato **lo stesso giorno** del post LinkedIn di Addy Osmani che traduce in una specifica di fase. Tesi: **la qualità ha cambiato indirizzo** — non si legge più nel codice (gli agenti ne producono più di quanto chiunque possa revisionare) ma nell'**anello di vincoli che circonda l'agente**. L'anello di Osmani (sette dimensioni — correttezza, sicurezza, prestazioni, accessibilità, manutenibilità, **efficienza economica**, **comprensibilità** — collegate dalla regola del **back-pressure**: "a un loop viene concessa solo l'autonomia che può essere verificata in modo economico e affidabile, non un millimetro di più") viene ridisegnato, tradotto e ancorato alla fase 5 del ciclo a 11 fasi di SFEIR. Il corollario strutturante: **il collo di bottiglia non è mai stato la generazione, è la verifica** — "la generazione è una bocca larga, la verifica un collo stretto; accelerare la bocca ispessisce l'accumulo al collo." **La decisione di design più interessante riguarda l'architettura del ciclo**: la Review è deliberatamente **fuori dai tre gate umani** (Define, Plan, Ship), perché fare della Review il gate metterebbe l'attenzione umana — una risorsa finita — come punto di controllo di una capacità di generazione che a sua volta scala: "si sarebbe costruita una pipeline il cui throughput massimo è il numero di diff che un senior può leggere prima della fine della giornata." Da qui la separazione: **la Review istruisce, lo Ship decide** — la Review fornisce un *corpo di prove opponibile*, lo Ship decide sulla base delle prove, non sull'intero diff. Una posizione presa contro Monperrus (di cui SFEIR conserva la diagnosi — l'ispezione umana di ogni diff non può reggere alla velocità agentica — ma respinge la conclusione: l'accettazione non può essere delegata). La trappola citata è la **validazione circolare** (l'agente che scrive il codice scrive i test che lo validano: "si è costruito uno specchio, non un anello"), con cinque contromisure tratte da Anthropic (gate indipendenti in finestre di contesto separate, deterministico e agentico che non si sostituiscono mai a vicenda, shadow mode, tiering basato sul rischio, logging verso il SIEM) e l'avvertimento di Compare the Market (**grafo AST ~70% contro RAG vettoriale ~58%**, con il RAG che si comporta *peggio di nessun contesto*). L'estensione propria dell'azienda è **il cricchetto**: "ogni fuga diventa un vincolo" — un difetto che ha attraversato l'anello viene chiuso *all'interno dell'anello* (test, regola di lint, rubrica di review, guardrail dell'harness) a Compound-1, "l'unico asset della catena che si apprezza mentre i modelli si deprezzano" (una misura interna non verificata: **−30% di iterazioni di fix dopo dieci cicli**). Si chiude riformulando la domanda: "questo codice è buono?" è diventata una domanda senza risposta; ciò che resta è **"che cosa il mio sistema si rifiuta di lasciar passare?"**

#anello di vincoli#vincoli attorno agli agenti#fase Review

SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market

Strumenti e Piattaforme Traduzione verificata automaticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Analisi del gabinetto di ingegneria SFEIR ("una lettura da ingegnere") sul lancio, il **16 luglio 2026**, di **Kimi K3** da parte del laboratorio cinese **Moonshot AI**: un modello **open-weights, di livello frontier**, il cui fornitore dichiara **circa 2.800 miliardi di parametri**, un **contesto da un milione di token** e il **rilascio dei pesi prima del 27 luglio 2026** (probabilmente con licenza Modified MIT, come per la linea K2). Tesi: una capacità un tempo ritenuta riservata ai giganti proprietari (Anthropic, OpenAI, Google) diventa disponibile **in open weights, a prezzo scontato, da un laboratorio cinese**. SFEIR — pur essendo **partner di Anthropic e Google Cloud**, e quindi "senza alcun interesse a sopravvalutare un modello cinese" — adotta una **riserva metodologica** cardinale: il giorno del lancio **non esiste alcuna tabella di benchmark ufficiale e completa**; le specifiche (2,8T, Kimi Delta Attention, +25% di efficienza di addestramento) e i punteggi sono **dichiarati dal fornitore** o tratti da **arene comunitarie**, "da trattare come affermazioni, non come fatti misurati." La nuova architettura (**Kimi Delta Attention**, attenzione lineare ibrida; decodifica dichiarata fino a **6,3 volte più veloce** a 1M di token) rompe con la cadenza K2 (K2 lug. 2025 → K2.7 Code giu. 2026, un modello di punta ogni due mesi); due varianti accompagnano il lancio (**K3 Max**, **K3 Swarm Max**), con dismissione forzata della serie kimi-k2.5/moonshot-v1 il **31 agosto 2026**. **La vera arma è il prezzo** (~3$/M in ingresso, 0,30$ in cache, 15$ in uscita secondo fonti secondarie): un modello open-weights di livello frontier a questo livello **trascina verso il basso l'intera curva prezzo-prestazioni** — la commodizzazione del livello modello, accelerata dall'open source. Ma la singolarità decisiva non è un punteggio: è la **reversibilità**. Un modello open-weights di livello frontier trasforma un'API consumata (dipendenza dal fornitore) in un'**opzione** (self-hosting, portabilità, uscita dal lock-in), al prezzo di un'infrastruttura pesante per ospitare 2,8T di parametri. Il punto di vista di SFEIR: **l'open-weights cambia la domanda, non solo la risposta** — non più "quale modello è il migliore/il più economico?" ma "quanta parte del mio sistema sono disposto a rendere dipendente da un fornitore che non controllo?". La postura corretta resta un **portafoglio instradato** (un modello per compito, un modello per vincolo), con Kimi K3 che aggiunge una **colonna "reversibilità"** alla griglia decisionale. La convinzione "AI Only" resta invariata: il modello è una commodity, il vantaggio duraturo risiede nell'ingegneria che lo circonda (Context Engineering, harness, governance dei costi, capacità di cambiare idea). Le cifre restano da validare "in autonomia" — sui propri repository, sui propri dati.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

L'ingénierie logicielle à l'ère de l'IA : tout change... et rien ne change

Editoriale di **Olivier Rafal** (Consulting Director Strategy, **WeNvision** — gruppo **SFEIR**; ex direttore responsabile di *Le Monde Informatique*) pubblicato il **1° giugno 2026** su **CIO-Online**, strutturato attorno a un **paradosso**: nell'era dell'IA, l'ingegneria del software **cambia tutto… e nulla cambia**. **Ciò che cambia è il modello operativo.** I ruoli vengono ridefiniti: il **Product Owner** passa dalla scomposizione del backlog alla **generazione di contesto utilizzabile dall'IA**; lo **sviluppatore** passa dalla scrittura di codice a **inquadrare, guidare e revisionare** l'esecuzione degli agenti; il **QA** acquisisce la capacità di definire a monte la **prova attesa**. La struttura dei team passa dalle *"double pizza teams"* (catene di passaggio di consegne di ~8 persone) alle ***"sandwich teams"***: un **binomio stretto tra un esperto di business e un tech lead, entrambi potenziati dall'IA**, con altre competenze a supporto. Dato interno **Sfeir**: *"questo binomio guida oggi circa l'80% della catena di produzione,"* il restante ~20% (architettura, governance dei dati, sicurezza) essendo centralizzato. Citazione chiave: ***"Il problema non è un problema di strumenti, è un problema di modello operativo."*** **Ciò che non cambia è la disciplina del ciclo.** Le fasi dello **SDLC** (definire → costruire → verificare → distribuire → mantenere) restano identiche e non negoziabili; l'IA non ne elimina nessuna, le **intensifica**: ***"tutto il margine che il ritmo umano assorbiva un tempo, per quanto imperfettamente, diventa, alla velocità dell'IA, un difetto di livello industriale"*** (metafora sportiva dilettante contro professionista). Da qui **tre *gate* inviolabili** (controllo umano): **specifica, pianificazione, revisione di consegna**; validazione **tramite prova** (non tramite le affermazioni dell'IA stessa); **capitalizzazione sistematica** (ogni ciclo alimenta il successivo) → risultato misurato: **−30% di iterazioni di correzione dopo ~10 cicli**. Principio: ***"più veloce è l'esecuzione, più rigoroso deve essere il quadro."*** Concetti richiamati: **harness** (regole agentiche adattate al contesto), **vibe coding** giudicato **insostenibile in azienda**. **Terzo pilastro = governance, FinOps e gestione orientata al valore**: costi IA **variabili e ricorrenti** (~**10 €/ora** per ruolo potenziato), passaggio dalla licenza forfettaria alla fatturazione a consumo (un parallelo con il cloud degli anni 2010); il **FinOps** non mira a tagliare i costi ma a *"ottimizzare l'efficienza degli strumenti"* (costo rispetto al valore); allineare a monte le **metriche di business** (time-to-market, funzionalità, prestazioni, eco-design). **Conclusione**: l'accelerazione rende i fondamentali **non negoziabili**; la sfida è **organizzativa e culturale**, non tecnologica — senza mettere in sicurezza la relazione con il business e la disciplina collettiva, uno SDLC potenziato dall'IA **amplifica solo i problemi** (schiantandosi contro il muro più velocemente). Estende la dottrina WeNvision di [[rafal-wenvision-ia-generative-produit-techno-pas-projet-2024-02-23]] e [[rafal-wenvision-tokenomics-foundation-finops-ia-2026-06-04]]; converge con *systems around the model* dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28, *harness engineering* osmani-agent-harness-engineering-2026-04-19, Salesforce agentico, e il dibattito sull'*agent manager* (BFM/Girard, SFEIR).

#ingegneria del software#IA#tutto cambia nulla cambia

**Olivier Rafal** · *Consulting Director Strategy* chez **WeNvision** (groupe **SFEIR**). Ancien **rédacteur en chef du *Monde Informatique*** · et auparavant consultant analyste du marché IT (~10 ans). Tribune publiée dans la rubrique *Tribune* de **CIO-Online**. Publié le **1er juin 2026**.