Vai al contenuto

root / tags / glm-5-2

#GLM-5.2

6 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Economia e Mercato Traduzione verificata automaticamente

Mistral AI wants to build 1 gigawatt of European compute by 2030 — and lock in customers now.

Articolo di attualità analizzato, pubblicato su **VentureBeat** l'**11 agosto 2026** da **Michael Nuñez**, basato su un'**intervista esclusiva con Timothée Lacroix**, co-fondatore e CTO di **Mistral AI**, realizzata prima dell'annuncio, ~2.000 parole. Mistral amplia la propria offerta infrastrutturale in tre parti: i **Mistral Regional Endpoints** in disponibilità generale (che ancorano l'inferenza e il trattamento associato all'Europa o agli Stati Uniti), un **Priority Tier** in anteprima pubblica (livelli di servizio garantiti, quote personalizzate, SLA di disponibilità) e una **coalizione di imprese europee** i cui impegni pluriennali sono destinati a finanziare **200 MW entro fine 2027** e **1 GW entro fine 2030**. Il veicolo si chiama **European Compute Unit (ECU)**: un diritto su una capacità costruita da Mistral, fungibile tra inferenza, addestramento, adattamento di modelli o Kubernetes gestito, su un orizzonte target di cinque anni. Lacroix descrive il meccanismo senza mezzi termini — *"The whole point of compute units is to have commitment"* — e, sull'uscita anticipata: *"There is no getting out."* L'articolo mette in scala l'ambizione: Mistral dichiara di operare *"less than 200 MW"* e dettaglia tre siti per un totale di **77 MW** (44 MW vicino a Parigi, 23 MW in Svezia con EcoDataCenter, 10 MW a Les Ulis); **Epoch AI** stima il capex iniziale per un data center IA da un gigawatt a **~38 miliardi di dollari**, e **Goldman Sachs Research** stima le strutture di nuova generazione a **15-20 milioni di dollari/MW esclusi i chip**, a fronte dei **~4 miliardi di dollari** raccolti in totale da Mistral (PitchBook). A questo si aggiunge una decisione che *"is likely to raise a few eyebrows among sovereignty purists"*: Mistral inizia a **ospitare modelli aperti di terze parti**, a partire da **GLM-5.2** di **Z.ai**, un laboratorio cinese — *"It's a great model. Everyone loves it. It's open-weight, so there was no good reason for us not to do it."* L'articolo entra nel dettaglio della documentazione di Mistral, che menziona *"limited, controlled transfers"* verso subappaltatori al di fuori della regione; interpellato sui dettagli, Lacroix rimanda alle **chiamate a strumenti** (tool calls), in particolare la ricerca web, e afferma che la **restrizione selettiva è la funzionalità, non il difetto**. L'inquadratura dell'autore: *"full regional control is available, but the moment an AI agent reaches out to the open web, sovereignty becomes a configuration decision, not a default."* Restano due dipendenze: le **GPU** provengono da Nvidia, e **Microsoft** — cliente-ancora dei data center europei di Mistral da luglio — viene presentato come ciò che riduce il rischio della costruzione.

#Mistral AI#sovranità digitale#sovranità IA

**Michael Nuñez** — journaliste **VentureBeat** · couvre l'IA et l'infrastructure ; déjà présent au corpus. L'article est bâti sur un **entretien exclusif avec Timothée Lacroix** · cofondateur et CTO de Mistral AI · conduit **avant l'annonce** · et fait suite à un entretien de juin avec le même interlocuteur. Publié le **11 août 2026**.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

The Token Manifesto

Nicolas Martignole (Le Touilleur Express), co-scritto con **GLM-5.2** e **MiniMax-M3**, pubblica **« The Token Manifesto »**: un pastiche del **Manifeste Agile** (2001) trasposto all'era degli LLM, dove l'unità di valore non è più l'ora-ingegnere ma il **token**. Quattro valori: *short system prompts over clever system prompts*, *one clear example over three paragraphs of explanation*, *iterating in small steps over dumping the whole spec at once*, *outputting in a defined format over letting the model freestyle*. Dodici principi sovvertono uno per uno quelli dell'Agile — "simplicity, the art of maximizing the amount of work **not done by the model**," "self-organizing teams that spot repetition and document it once," "regular reflection **before the monthly bill arrives**." Sotto l'umorismo ("staring at a usage bar nervously") si cela una tesi seria: il vero vincolo economico dello sviluppo assistito dall'IA non è più la velocità ma il **token budget** e l'economia della **finestra di contesto**. Due battute finali chiudono il testo: **« You don't have a prompt problem. You have a context-window problem. »** e **« Everyone's a prompt engineer until they run out of monthly quota. »** Da notare, la strizzata d'occhio meta: un manifesto sulla frugalità dei token co-scritto *con* i modelli.

#The Token Manifesto#Nicolas Martignole#Le Touilleur Express

Nicolas Martignole (Le Touilleur Express) · avec GLM-5.2 et MiniMax-M3

Strumenti e Piattaforme Traduzione verificata automaticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Analisi del gabinetto di ingegneria SFEIR ("una lettura da ingegnere") sul lancio, il **16 luglio 2026**, di **Kimi K3** da parte del laboratorio cinese **Moonshot AI**: un modello **open-weights, di livello frontier**, il cui fornitore dichiara **circa 2.800 miliardi di parametri**, un **contesto da un milione di token** e il **rilascio dei pesi prima del 27 luglio 2026** (probabilmente con licenza Modified MIT, come per la linea K2). Tesi: una capacità un tempo ritenuta riservata ai giganti proprietari (Anthropic, OpenAI, Google) diventa disponibile **in open weights, a prezzo scontato, da un laboratorio cinese**. SFEIR — pur essendo **partner di Anthropic e Google Cloud**, e quindi "senza alcun interesse a sopravvalutare un modello cinese" — adotta una **riserva metodologica** cardinale: il giorno del lancio **non esiste alcuna tabella di benchmark ufficiale e completa**; le specifiche (2,8T, Kimi Delta Attention, +25% di efficienza di addestramento) e i punteggi sono **dichiarati dal fornitore** o tratti da **arene comunitarie**, "da trattare come affermazioni, non come fatti misurati." La nuova architettura (**Kimi Delta Attention**, attenzione lineare ibrida; decodifica dichiarata fino a **6,3 volte più veloce** a 1M di token) rompe con la cadenza K2 (K2 lug. 2025 → K2.7 Code giu. 2026, un modello di punta ogni due mesi); due varianti accompagnano il lancio (**K3 Max**, **K3 Swarm Max**), con dismissione forzata della serie kimi-k2.5/moonshot-v1 il **31 agosto 2026**. **La vera arma è il prezzo** (~3$/M in ingresso, 0,30$ in cache, 15$ in uscita secondo fonti secondarie): un modello open-weights di livello frontier a questo livello **trascina verso il basso l'intera curva prezzo-prestazioni** — la commodizzazione del livello modello, accelerata dall'open source. Ma la singolarità decisiva non è un punteggio: è la **reversibilità**. Un modello open-weights di livello frontier trasforma un'API consumata (dipendenza dal fornitore) in un'**opzione** (self-hosting, portabilità, uscita dal lock-in), al prezzo di un'infrastruttura pesante per ospitare 2,8T di parametri. Il punto di vista di SFEIR: **l'open-weights cambia la domanda, non solo la risposta** — non più "quale modello è il migliore/il più economico?" ma "quanta parte del mio sistema sono disposto a rendere dipendente da un fornitore che non controllo?". La postura corretta resta un **portafoglio instradato** (un modello per compito, un modello per vincolo), con Kimi K3 che aggiunge una **colonna "reversibilità"** alla griglia decisionale. La convinzione "AI Only" resta invariata: il modello è una commodity, il vantaggio duraturo risiede nell'ingegneria che lo circonda (Context Engineering, harness, governance dei costi, capacità di cambiare idea). Le cifre restano da validare "in autonomia" — sui propri repository, sui propri dati.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Trasformazione e Adozione Traduzione verificata automaticamente

AI4IT vs AI4Business : le renversement, et ce qu'il fait à vos budgets 2027

Approfondimento (punto di vista) pubblicato su **sfeir.com** il 24 giugno 2026, a firma di **Didier Girard** (Managing Director, SFEIR). **Tesi centrale**: nel 2024 tutti puntavano sull'**AI4Business** (l'IA nei processi aziendali) come grande giacimento di valore; nel 2026 il quadro si è **ribaltato** — è l'**AI4IT** (l'IA per produrre il sistema informativo: codice, SDLC, fabbrica del software) a generare valore **misurabile**. L'articolo *fonda* questa tesi sulla veille tecnologica dell'azienda: delusione dell'AI4Business (lo studio del MIT "95% dei pilot senza ROI", contestato ma rivelatore; un blocco **organizzativo** / il problema hayekiano di Mollick) contro le evidenze quantificate dell'AI4IT (Salesforce, Intercom, Raiffeisen, AWS/Bedrock, Atlassian, DORA). Spiegazione meccanicistica: **il codice si verifica da solo** (compilazione, test, CI) mentre i processi aziendali non hanno né compilatore né loop di feedback immediato. **Conseguenza sui budget 2027**: uno spostamento **CapEx→OpEx**, la dinamica del prezzo dei token (picco in salita — Fable 5 a 2× Opus — contro un'inferenza ÷280 e la pressione al ribasso dei pesi aperti/dell'inferenza desktop), e un **AI FinOps** guidato dal **costo per risultato**. Si chiude con **4 raccomandazioni per il COMEX**.

#AI4IT#AI4Business#ribaltamento

**Didier Girard** — Managing Director (CTO / DG) de **SFEIR** · ESN française (~1 000 personnes, France · Belgique · Luxembourg · Suisse). Auteur de l'article ; voix éditoriale du cabinet sur la transformation IA des DSI.

Economia e Mercato Traduzione verificata automaticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annuncio di benchmark da **Artificial Analysis** (piattaforma indipendente di valutazione di modelli AI, via X/Twitter + pagina del modello): **GLM-5.2** di **Z.ai** (Zhipu AI, @Zai_org) diventa **il modello open weights leader** e sale al **#3 posto nella classifica generale** di **GDPval-AA**, un benchmark basato su casi reali per il *lavoro intellettuale economicamente rilevante* (compiti agentic, multi-turno, a lungo orizzonte). GLM-5.2 ottiene **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 (xhigh, 1509)**. Precede con largo margine il miglior modello open successivo (**MiniMax-M3, 1408**), insieme a numerosi modelli proprietari: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. I compiti sono autenticamente agentic: **~31 turni per compito** in media su **1.999 confronti**. La stessa classifica si conferma sull'**Artificial Analysis Intelligence Index** (1° tra i modelli open weights), sull'**Agentic Index** (#3) e su **AA-Briefcase** (#3, davanti a GPT-5.5 xhigh, dietro solo a Fable 5). Da segnalare: un modello **open weights** con licenza **MIT**, **MoE con 753 miliardi di parametri / 40 miliardi attivi**, **contesto di 1M token**, con un prezzo di **1,40$/4,40$ per 1M di token** in input/output, che rivaleggia con la frontiera proprietaria sul lavoro agentic — un vero passo avanti per i modelli open.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)