Vai al contenuto

root / tags / z-ai

#Z.ai

5 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Economia e Mercato Traduzione verificata automaticamente

Mistral AI wants to build 1 gigawatt of European compute by 2030 — and lock in customers now.

Articolo di attualità analizzato, pubblicato su **VentureBeat** l'**11 agosto 2026** da **Michael Nuñez**, basato su un'**intervista esclusiva con Timothée Lacroix**, co-fondatore e CTO di **Mistral AI**, realizzata prima dell'annuncio, ~2.000 parole. Mistral amplia la propria offerta infrastrutturale in tre parti: i **Mistral Regional Endpoints** in disponibilità generale (che ancorano l'inferenza e il trattamento associato all'Europa o agli Stati Uniti), un **Priority Tier** in anteprima pubblica (livelli di servizio garantiti, quote personalizzate, SLA di disponibilità) e una **coalizione di imprese europee** i cui impegni pluriennali sono destinati a finanziare **200 MW entro fine 2027** e **1 GW entro fine 2030**. Il veicolo si chiama **European Compute Unit (ECU)**: un diritto su una capacità costruita da Mistral, fungibile tra inferenza, addestramento, adattamento di modelli o Kubernetes gestito, su un orizzonte target di cinque anni. Lacroix descrive il meccanismo senza mezzi termini — *"The whole point of compute units is to have commitment"* — e, sull'uscita anticipata: *"There is no getting out."* L'articolo mette in scala l'ambizione: Mistral dichiara di operare *"less than 200 MW"* e dettaglia tre siti per un totale di **77 MW** (44 MW vicino a Parigi, 23 MW in Svezia con EcoDataCenter, 10 MW a Les Ulis); **Epoch AI** stima il capex iniziale per un data center IA da un gigawatt a **~38 miliardi di dollari**, e **Goldman Sachs Research** stima le strutture di nuova generazione a **15-20 milioni di dollari/MW esclusi i chip**, a fronte dei **~4 miliardi di dollari** raccolti in totale da Mistral (PitchBook). A questo si aggiunge una decisione che *"is likely to raise a few eyebrows among sovereignty purists"*: Mistral inizia a **ospitare modelli aperti di terze parti**, a partire da **GLM-5.2** di **Z.ai**, un laboratorio cinese — *"It's a great model. Everyone loves it. It's open-weight, so there was no good reason for us not to do it."* L'articolo entra nel dettaglio della documentazione di Mistral, che menziona *"limited, controlled transfers"* verso subappaltatori al di fuori della regione; interpellato sui dettagli, Lacroix rimanda alle **chiamate a strumenti** (tool calls), in particolare la ricerca web, e afferma che la **restrizione selettiva è la funzionalità, non il difetto**. L'inquadratura dell'autore: *"full regional control is available, but the moment an AI agent reaches out to the open web, sovereignty becomes a configuration decision, not a default."* Restano due dipendenze: le **GPU** provengono da Nvidia, e **Microsoft** — cliente-ancora dei data center europei di Mistral da luglio — viene presentato come ciò che riduce il rischio della costruzione.

#Mistral AI#sovranità digitale#sovranità IA

**Michael Nuñez** — journaliste **VentureBeat** · couvre l'IA et l'infrastructure ; déjà présent au corpus. L'article est bâti sur un **entretien exclusif avec Timothée Lacroix** · cofondateur et CTO de Mistral AI · conduit **avant l'annonce** · et fait suite à un entretien de juin avec le même interlocuteur. Publié le **11 août 2026**.

Strumenti e Piattaforme Traduzione verificata automaticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Analisi del gabinetto di ingegneria SFEIR ("una lettura da ingegnere") sul lancio, il **16 luglio 2026**, di **Kimi K3** da parte del laboratorio cinese **Moonshot AI**: un modello **open-weights, di livello frontier**, il cui fornitore dichiara **circa 2.800 miliardi di parametri**, un **contesto da un milione di token** e il **rilascio dei pesi prima del 27 luglio 2026** (probabilmente con licenza Modified MIT, come per la linea K2). Tesi: una capacità un tempo ritenuta riservata ai giganti proprietari (Anthropic, OpenAI, Google) diventa disponibile **in open weights, a prezzo scontato, da un laboratorio cinese**. SFEIR — pur essendo **partner di Anthropic e Google Cloud**, e quindi "senza alcun interesse a sopravvalutare un modello cinese" — adotta una **riserva metodologica** cardinale: il giorno del lancio **non esiste alcuna tabella di benchmark ufficiale e completa**; le specifiche (2,8T, Kimi Delta Attention, +25% di efficienza di addestramento) e i punteggi sono **dichiarati dal fornitore** o tratti da **arene comunitarie**, "da trattare come affermazioni, non come fatti misurati." La nuova architettura (**Kimi Delta Attention**, attenzione lineare ibrida; decodifica dichiarata fino a **6,3 volte più veloce** a 1M di token) rompe con la cadenza K2 (K2 lug. 2025 → K2.7 Code giu. 2026, un modello di punta ogni due mesi); due varianti accompagnano il lancio (**K3 Max**, **K3 Swarm Max**), con dismissione forzata della serie kimi-k2.5/moonshot-v1 il **31 agosto 2026**. **La vera arma è il prezzo** (~3$/M in ingresso, 0,30$ in cache, 15$ in uscita secondo fonti secondarie): un modello open-weights di livello frontier a questo livello **trascina verso il basso l'intera curva prezzo-prestazioni** — la commodizzazione del livello modello, accelerata dall'open source. Ma la singolarità decisiva non è un punteggio: è la **reversibilità**. Un modello open-weights di livello frontier trasforma un'API consumata (dipendenza dal fornitore) in un'**opzione** (self-hosting, portabilità, uscita dal lock-in), al prezzo di un'infrastruttura pesante per ospitare 2,8T di parametri. Il punto di vista di SFEIR: **l'open-weights cambia la domanda, non solo la risposta** — non più "quale modello è il migliore/il più economico?" ma "quanta parte del mio sistema sono disposto a rendere dipendente da un fornitore che non controllo?". La postura corretta resta un **portafoglio instradato** (un modello per compito, un modello per vincolo), con Kimi K3 che aggiunge una **colonna "reversibilità"** alla griglia decisionale. La convinzione "AI Only" resta invariata: il modello è una commodity, il vantaggio duraturo risiede nell'ingegneria che lo circonda (Context Engineering, harness, governance dei costi, capacità di cambiare idea). Le cifre restano da validare "in autonomia" — sui propri repository, sui propri dati.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Economia e Mercato Traduzione verificata automaticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annuncio di benchmark da **Artificial Analysis** (piattaforma indipendente di valutazione di modelli AI, via X/Twitter + pagina del modello): **GLM-5.2** di **Z.ai** (Zhipu AI, @Zai_org) diventa **il modello open weights leader** e sale al **#3 posto nella classifica generale** di **GDPval-AA**, un benchmark basato su casi reali per il *lavoro intellettuale economicamente rilevante* (compiti agentic, multi-turno, a lungo orizzonte). GLM-5.2 ottiene **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 (xhigh, 1509)**. Precede con largo margine il miglior modello open successivo (**MiniMax-M3, 1408**), insieme a numerosi modelli proprietari: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. I compiti sono autenticamente agentic: **~31 turni per compito** in media su **1.999 confronti**. La stessa classifica si conferma sull'**Artificial Analysis Intelligence Index** (1° tra i modelli open weights), sull'**Agentic Index** (#3) e su **AA-Briefcase** (#3, davanti a GPT-5.5 xhigh, dietro solo a Fable 5). Da segnalare: un modello **open weights** con licenza **MIT**, **MoE con 753 miliardi di parametri / 40 miliardi attivi**, **contesto di 1M token**, con un prezzo di **1,40$/4,40$ per 1M di token** in input/output, che rivaleggia con la frontiera proprietaria sul lavoro agentic — un vero passo avanti per i modelli open.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

L'editoriale di Andrew Ng su The Batch #350 delinea una **gerarchia di accelerazione per gli agenti di coding** in base al tipo di lavoro software: **Frontend (massima) > Backend (moderata) > Infrastruttura (bassa) > Ricerca (minima)**. La motivazione poggia sulla *verificabilità* implicita (padronanza di TypeScript/JavaScript più un ciclo di test autonomo agente-browser sul frontend) e sui punti ciechi degli LLM (casi limite / sicurezza / migrazioni di database per il backend, compromessi di rete opachi per l'infrastruttura, formazione di ipotesi irriducibile per la ricerca). Il numero è completato da 4 notizie strutturanti: **GLM-5.1 (Z.ai)**, un modello con 754B parametri (40B attivi) sotto licenza MIT capace di compiti autonomi della durata di 8 ore (leader su SWE-Bench Pro con il 58,4%); **Digit (Agility Robotics) presso Schaeffler**, il primo dispiegamento industriale di umanoidi (5'9"/143lb, 10-25 $/h contro 20 $/h per un umano); la **rivolta anti-data-center** (~64 miliardi di dollari bloccati da maggio 2024 a marzo 2025, moratoria del Maine sugli impianti da 20MW+, cocktail Molotov contro l'abitazione di Sam Altman); e l'**"assistant axis"** (Christina Lu, MATS / Oxford / Anthropic), che riduce la deriva della persona e i jailbreak (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) senza degradare IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités