The state of open source AI (v1.0.1, juillet 2026)
Rapporto ricorrente di Mozilla, The state of open source AI, v1.0.1, luglio 2026, introdotto da una lettera di Raffi Krikorian (CTO): sette sezioni, un sito interattivo e un rapporto scaricabile.
Di **Mozilla** — éditeur du rapport// Fonte stateofopensource.ai ↗/Lettura 2 min/.md// Traduzione verificata automaticamente
#Mozilla#state of open source AI#pesi open#pesi open#IA open source#definizione OSI#codice di addestramento#documentazione dei dati
Rapporto ricorrente di Mozilla, The state of open source AI (v1.0.1, luglio 2026), introdotto dal suo CTO Raffi Krikorian.
La tesi apre la prima sezione: « Il livello del modello si è commoditizzato. Il valore si sposta sull'harness sovrastante. » Gli input diventati commodity perdono il proprio potere di prezzo, e la maggioranza dei carichi di lavoro in produzione gira ben al di sotto del tetto della frontiera.
Un harness calibrato strettamente sui pesi di un laboratorio… degrada su qualsiasi altro modello, quindi più stretta è la calibrazione, meno intercambiabili sono i pesi sottostanti. Il lock-in arriva come effetto collaterale dell'ottimizzazione.
— **Mozilla** — éditeur du rapport , stateofopensource.ai
Stato delle capacità. Sull'Artificial Analysis Intelligence Index, il miglior modello chiuso ottiene 61 punti (Claude Opus 5), il miglior modello open 57 (Kimi K3), quarto in classifica generale; sull'Epoch Capabilities Index lo scarto è di sei punti, "all'incirca un ciclo di release", con intervalli di confidenza sovrapposti. La frontiera è a dente di sega: l'open è in testa nel codice frontend, contende il lavoro agentico da terminale, e cede chiaramente terreno sul lavoro professionale di conoscenza.
Lo spostamento d'uso. La quota di token OpenRouter instradati verso pesi open è salita da un livello trascurabile a una maggioranza entro metà 2026, con i sette modelli a maggior volume tutti open — ma il rapporto osserva che in numero di richieste, i fornitori chiusi restano in testa, il vantaggio open essendo un vantaggio in volume di token concentrato nei carichi di lavoro di coding e agentici.
Il risultato centrale: « L'open si spedisce facilmente. L'open si distribuisce con difficoltà. » Il 79% degli sviluppatori usa modelli open contro il 71% chiuso, con metà che usa entrambi; ma solo il 53% dei team open raggiunge la produzione contro il 63%, e lo scarto si allarga con la dimensione dell'azienda, il che esclude una spiegazione basata sulle risorse. La mappa dello stack lo conferma: due colonne fredde su ogni livello, standardizzazione e prontezza enterprise.
L'harness è la nuova frontiera.« L'harness agentico è un altro user agent » — il ruolo del browser replicato un livello più su. E il meccanismo di lock-in è enunciato con precisione: l'harness di un laboratorio, calibrato sui propri pesi, degrada su quelli di chiunque altro, quindi « più stretta è la calibrazione, meno intercambiabili sono i pesi sottostanti. Il lock-in arriva come effetto collaterale dell'ottimizzazione. »
La sovranità è inquadrata come un diritto di uscita, illustrato dal blackout di diciannove giorni di Fable 5 legato ai controlli sulle esportazioni: « Si può spegnere un modello. Non si può spegnere una copia già in esecuzione su una macchina che si possiede. »
Mozilla difende ciò che misura. Didascalie scrupolose e una watchlist di condizioni di smentita dichiarate rendono i dati utilizzabili; l'inquadramento resta una tesi.
Punti chiave
Data / fonte.The state of open source AI, Mozilla, v1.0.1, luglio 2026, introduzione di Raffi Krikorian (CTO). Fonti terze citate (Artificial Analysis, Epoch AI, OpenRouter, LMArena) e sondaggio proprietario con SlashData (n = 1.410 sulle barriere all'adozione).
Inquadramento chiave.« Il livello del modello si è commoditizzato. Il valore si sposta sull'harness sovrastante. » Motivazione: « Gli input diventati commodity perdono il potere di prezzo », e la maggioranza dei carichi di lavoro in produzione gira ben al di sotto del tetto della frontiera. ### La distinzione terminologica da tenere a mente | Termine | Cosa copre | |---|---| | Open model | pesi scaricabili, eseguibili e modificabili su hardware sotto il proprio controllo | | Open weights | parametri sotto licenza permissiva, senza codice di addestramento né documentazione dei dati — « il che descrive la maggior parte di ciò che questo rapporto misura » | | Open source AI (senso OSI) | richiede in aggiunta il codice di addestramento e informazioni sui dati sufficienti a ricostruire il sistema | Il rapporto è intitolato open source AI ma misura in stragrande maggioranza open weights. Lo dichiara esplicitamente; le sintesi che se ne trarranno no. ### Divario di capacità, due strumenti coerenti | Strumento | Chiuso | Open | Scarto | |---|---|---|---| | Artificial Analysis Intelligence Index v4.1 | 61 (Claude Opus 5) | 57 (Kimi K3) | 4 pt; K3 4° su 586 modelli, 3 dei primi 11 open-weight | | Epoch Capabilities Index | 162 (GPT-5.6 Sol) | 156 (K3) | 6 pt ≈ un ciclo di release, intervalli di confidenza sovrapposti | Sul prezzo, K3 si colloca a 3,6 punti dal vertice per circa un terzo del prezzo. ### La frontiera a dente di sega L'open è in testa nel codice frontend (K3, 1.679 Elo, sei domini su sette sulla LMArena Frontend Code Arena); contende il lavoro agentico da terminale (88,3 contro 88,8 su Terminal-Bench 2.1; K3 vince Program Bench, SpreadsheetBench 2 e BrowseComp, perde su FrontierSWE 81,2 contro 86,6); cede terreno sul lavoro professionale di conoscenza (Fable 5 è in testa di 92 Elo su GDPval-AA v2, il divario più ampio tra i benchmark condivisi, e Moonshot lo ammette). Da cui: « Abbinate il modello al compito e vi servirà la frontiera meno di quanto pensiate. » Il rapporto avverte che i punteggi usano scale diverse e provengono per lo più da test gestiti dai fornitori — « vanno trattati come indicativi ». ### La cifra più citata a sproposito I pesi open sono passati da una base trascurabile a un terzo dei token OpenRouter entro fine 2025, poi a una maggioranza entro metà 2026, con i sette modelli a maggior volume tutti open-weight (72,4% del volume dei primi 20 detenuto dai ranghi open-weight 1-10). Ma: « In numero di richieste, i fornitori chiusi statunitensi restano in testa. Il vantaggio open è un vantaggio in volume di token, concentrato nei carichi di lavoro di coding e agentici », e le quote coprono solo i primi 20. Una maggioranza di token non è una maggioranza di casi d'uso. ### Il deployment prevale sulla capacità « L'open si spedisce facilmente. L'open si distribuisce con difficoltà. » Il 79% degli sviluppatori che adottano l'IA usa modelli open contro il 71% chiuso, e il 50% usa entrambi (29% solo open, 21% solo chiuso): le due categorie sono complementari, non rivali. Ma il 53% dei team open raggiunge la produzione contro il 63% chiuso, e lo scarto si allarga con la dimensione — chiuso 54% → 73%, open 53% → 57%. « La scala esclude una spiegazione basata sulle risorse. Le grandi imprese possono comprarsi il passaggio attraverso il deployment chiuso. Il deployment open attende strumenti che restano incompleti. » Barriere nominate, tutte operative: costo dell'infrastruttura, sicurezza e conformità, manutenzione, complessità del deployment. La mappa dello stack (48 componenti, 9 livelli, 10 criteri) lo conferma da un'altra angolazione: due colonne costantemente fredde su ogni livello — standardizzazione e prontezza enterprise. ### Sezione 5: l'harness come user agent L'analogia è il browser, « codice dal lato dell'utente che negozia con i server per suo conto », replicato un livello più su. L'harness è « dove si concentra la difficoltà della produzione, e dove ricomincia lo scontro open-contro-chiuso, proprietario-contro-affittuario ». Cinque livelli mappati: Govern (policy stateful, registro e tracciabilità, budget e revoca), Surface (AG-UI/A2UI, x402/AP2/UCP), Action (sandbox E2B/Daytona/Modal, permessi e identità — « la superficie di scrittura irrisolta » —, valutazione e osservabilità), Reach (MCP, A2A, memoria), Control (LangGraph, CrewAI, AutoGen, LlamaIndex). La formula « la superficie di scrittura irrisolta » fa eco alla diagnosi in [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]]: la lettura è risolta, la scrittura no. ### Il meccanismo di lock-in « Il modello sta divorando l'harness. » Su ogni modello in cui coesistono l'harness proprietario di un laboratorio e un harness indipendente, il primo ora vince, con lo scarto di 21,8 punti compresso a circa 3 al vertice. Da cui: « Un harness calibrato strettamente sui pesi di un laboratorio diventa un componente su misura del prodotto di quel laboratorio. Degrada su qualsiasi altro modello, quindi più stretta è la calibrazione, meno intercambiabili sono i pesi sottostanti. Il lock-in arriva come effetto collaterale dell'ottimizzazione. » Il lock-in non ha bisogno di essere una strategia: basta ottimizzare. Da confrontare con il contratto di portabilità in [[janakiram-agent-platform-portability-contract-2026-07-20]]. ### Trazione ed economia LangChain con oltre 126.000 stelle e il 60% di quota tra gli sviluppatori; MCP a 97M di download mensili dell'SDK e oltre 10.000 server attivi nell'arco di un anno, +4.750% in 16 mesi, consegnato all'Agentic AI Foundation nel dicembre 2025. Divario di governance: solo ~21% delle imprese dichiara una governance matura degli agenti. Sui prezzi, l'inferenza è calata di 50 volte in 36 mesi al livello di GPT-4 (contro 2,6 volte per la banda passante durante l'era dotcom), con il prezzo di frontiera sceso di 112 volte rispetto ai 45 dollari di GPT-4. Su OpenRouter (maggio-settembre 2025), il chiuso deteneva circa l'80% dell'uso e il 96% dei ricavi — a parità di qualità, costa circa 6 volte di più per chiamata, il che implica un risparmio annuo stimato non realizzato di circa 24,8 miliardi di dollari (studio Nagle-Yue per la Linux Foundation). ### Sovranità e diritto di uscita Più di 70 strategie nazionali attive, e « l'argomento strategico a favore dell'open è la capacità di andarsene », sostenuto dal precedente del cloud (90-120 mila dollari per far uscire un petabyte da S3, 37signals sceso da 3,2 milioni a meno di 1 milione di dollari, l'80% delle imprese in fase di rimpatrio). « Le API dei modelli chiusi riproducono la stessa trappola… I pesi open sono diritti di uscita. »Il blackout di diciannove giorni rende l'argomento concreto: 9 giugno, Anthropic rilascia Fable 5 e Mythos 5 → 12 giugno, il Dipartimento del Commercio applica controlli sulle esportazioni con effetto immediato, negando l'accesso a qualsiasi cittadino straniero, compresi i dipendenti di Anthropic stessa; poiché la nazionalità non è verificabile in tempo reale, entrambi i modelli si spengono per tutti → 26 giugno, ripristino parziale di Mythos per circa 100 organizzazioni statunitensi di infrastrutture critiche → 30 giugno, revoca del blocco → 1° luglio, ripristino di Fable 5. Poi il 16 luglio, Moonshot apre l'API di K3. « L'accesso può essere revocato e ripristinato. Un rilascio di pesi non può essere ritirato una volta che i file sono distribuiti… Si può spegnere un modello. Non si può spegnere una copia già in esecuzione su una macchina che si possiede. » ### Cina Qwen ha superato le successive otto organizzazioni messe insieme nei download di Hugging Face entro febbraio 2026; i modelli open-weight cinesi sono passati da meno del 2% dei token OpenRouter a fine 2024 a oltre il 45% del traffico settimanale entro aprile 2026, circa il 61% tra i dieci modelli più usati. DeepSeek rivendica oltre 26.000 account enterprise ed era presente nel 58% degli stack delle nuove startup IA nel 2025, anche se almeno otto giurisdizioni hanno limitato il servizio ospitato: « Le imprese vietano l'app ospitata e adottano comunque i pesi. » ### Il caso della distillazione di K3, secondo le categorie stesse del rapporto | Livello | Contenuto | |---|---| | Confermato | la rivelazione di Anthropic di febbraio 2026 — circa 24.000 account fraudolenti, oltre 16M di scambi di cui 3,4M attribuiti a Moonshot, contro modelli Claude precedenti; dichiarazioni di Kratsios (22 luglio) e Bessent (21) | | Segnale | Greenblatt (Redwood Research): K3 si autoidentifica come Claude in un modo statisticamente difficile da spiegare come rumore — ma nomina un modello precedente al caso, e l'autoidentificazione è un artefatto noto dell'addestramento su testo web | | Prova | assente — « Nessun log e nessun pacchetto forense. Moonshot nega. » | Il rapporto osserva che la pubblicazione dei pesi rende ora possibile una forensica comportamentale. L'accusa non dovrebbe mai essere presentata come accertata. ### La watchlist e il suo metodo Quattro famiglie di segnali (capacità/adozione, harness, struttura di mercato, fiducia/sicurezza), ciascuna abbinata a una propria condizione di smentita — « Si inverte se: il vantaggio dell'harness di laboratorio si allarga, oppure una piattaforma chiusa fissa per prima lo standard dei permessi ». Dichiarare in anticipo cosa smentirebbe la tesi è ciò che distingue questo documento da un normale testo di advocacy. ### Una nota di cautela sulla citazione Mozilla sta misurando un tema di cui è sostenitrice. Il rigore delle sue didascalie e la presenza di condizioni di smentita rendono i dati utilizzabili; l'inquadramento — commoditizzazione compiuta, apertura inevitabile, « l'open ha vinto » — è una tesi, non un dato accertato.
Dati chiave
57 sull'Artificial Analysis Intelligence Index v4.1, contro 61 per il miglior modello chiuso
il livello modello si è commoditizzato e il valore risale verso l'harness agentico
— Mozilla
il vantaggio dei pesi aperti è un volume di token e non un numero di richieste, concentrato su coding e agentico
— Mozilla
nessun log né dossier forense supporta l'accusa di distillazione, che Moonshot smentisce
— Mozilla
Kimi K3 aurait été entraîné par extraction covert à grande échelle depuis Fable 5
— Michael Kratsios
Il grafo di conoscenza estratto da questa fiche — 8 entità, 25 relazioni.
In questo grafo :The state of open source AI · Mozilla · Raffi Krikorian · open-weights · écart opérationnel · verrouillage par optimisation · surface d'écriture non résolue · droit de sortie