# artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22

## Veille

Annuncio di benchmark da **Artificial Analysis** (piattaforma indipendente di valutazione di modelli AI, via X/Twitter + pagina del modello): **GLM-5.2** di **Z.ai** (Zhipu AI, @Zai_org) diventa **il modello open weights leader** e sale al **#3 posto nella classifica generale** di **GDPval-AA**, un benchmark basato su casi reali per il *lavoro intellettuale economicamente rilevante* (compiti agentic, multi-turno, a lungo orizzonte). GLM-5.2 ottiene **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 (xhigh, 1509)**. Precede con largo margine il miglior modello open successivo (**MiniMax-M3, 1408**), insieme a numerosi modelli proprietari: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. I compiti sono autenticamente agentic: **~31 turni per compito** in media su **1.999 confronti**. La stessa classifica si conferma sull'**Artificial Analysis Intelligence Index** (1° tra i modelli open weights), sull'**Agentic Index** (#3) e su **AA-Briefcase** (#3, davanti a GPT-5.5 xhigh, dietro solo a Fable 5). Da segnalare: un modello **open weights** con licenza **MIT**, **MoE con 753 miliardi di parametri / 40 miliardi attivi**, **contesto di 1M token**, con un prezzo di **1,40$/4,40$ per 1M di token** in input/output, che rivaleggia con la frontiera proprietaria sul lavoro agentic — un vero passo avanti per i modelli open.

## Titre Article

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

## Date

2026-06-22

## URL

https://artificialanalysis.ai/models/glm-5-2

## Keywords

GLM-5.2, Z.ai, Zhipu AI, modelli open weights, open weights, GDPval-AA, benchmark agentic, lavoro intellettuale, Elo, compiti multi-turno, long-horizon, Artificial Analysis Intelligence Index, Agentic Index, AA-Briefcase, Mixture of Experts, licenza MIT, contesto 1M token, reasoning, costo per token, frontiera proprietaria, Claude Fable 5, MiniMax-M3

## Authors

Artificial Analysis (@ArtificialAnlys)

## Ton

Profilo: un annuncio di benchmark fattuale e basato sui dati dal punto di vista di un **valutatore terzo indipendente** (Artificial Analysis), diffuso come thread X/Twitter supportato da una pagina dettagliata del modello, registro neutro in inglese basato sui dati, alto livello tecnico, rivolto a ingegneri ML, decisori tecnici, acquirenti di API e osservatori del mercato dei modelli fondazionali. Il tono è quello di un **confronto oggettivato delle prestazioni**: classifiche (Elo, indici), cifre precise (1524, ~31 turni, 1.999 confronti, 1,40$/4,40$) e una metodologia esplicita (brief identici forniti a più modelli, output resi così come prodotti). L'autorevolezza si fonda sulla **reputazione di neutralità** di Artificial Analysis e sulla trasparenza metodologica (resa degli output effettivi, molteplicità di indici incrociati). La retorica, priva di enfasi commerciale, lascia che i numeri portino la tesi implicita: il divario tra modelli **open** e **proprietari** si sta riducendo sul terreno più esigente — il lavoro agentic economicamente utile. Metafora implicita: il benchmark come "esercizio professionale" (i compiti di un supervisore di negozio, ecc.) piuttosto che un test accademico astratto. L'unico giudizio di valore esplicito — *"un vero passo avanti per i modelli open"* — è misurato e fondato sul rapporto prezzo/prestazioni.

## Pense-betes

- **Fatto centrale**: **GLM-5.2** (Z.ai / Zhipu AI) = **modello open weights #1** e **#3 in classifica generale** su **GDPval-AA** con **1524 Elo**.
- **Podio GDPval-AA**: 1. **Claude Fable 5 (1783)**; 2. **Claude Opus 4.8 (1615)**; 3. **GLM-5.2 (1524)** — alla pari con **GPT-5.5 (xhigh, 1509)**.
- **Dominio open weights**: il miglior modello open successivo, **MiniMax-M3**, si ferma a soli **1408** (ampio margine).
- **Supera modelli proprietari**: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**.
- **Cosa misura GDPval-AA**: le prestazioni su **lavoro intellettuale reale ed economicamente rilevante**, tramite **compiti multi-turno a lungo orizzonte**; copre sia il lavoro professionale SIA quello creativo (es. l'elenco dei compiti giornalieri di un supervisore di negozio al dettaglio, un documento IEC…). Metodo: brief identici forniti a GLM-5.2 + 3 modelli proprietari di frontiera (Fable 5, GPT-5.5, Gemini 3.5 Flash), **output resi esattamente come prodotti**.
- **Autenticamente agentic**: GLM-5.2 ha registrato in media **~31 turni per compito** su **1.999 confronti**.
- **Coerenza tra indici**: #1 tra i modelli open weights sull'**Artificial Analysis Intelligence Index**, **#3 sull'Agentic Index**, **#3 su AA-Briefcase** (su AA-Briefcase: miglior modello open weights, davanti a GPT-5.5 xhigh, dietro solo a Fable 5).
- **Specifiche (pagina del modello)**: **MoE 753B parametri / 40B attivi**, **modello di reasoning** (extended thinking), **contesto di 1M token**, **text-to-text**, licenza **MIT** (uso commerciale), pesi su Hugging Face, **rilasciato il 16 giugno 2026**.
- **Economia**: **1,40$ / 4,40$** per 1M di token (input/output), **cache hit 0,26$** (-81%), tariffa media **~0,90$/1M**; throughput **106,3 token/s**, TTFT **1,36 s**; costo totale della valutazione **982,90$**. → Argomento prezzo/prestazioni: frontiera agentic a prezzo open weights.
- **Tesi implicita**: la convergenza open/proprietario si gioca ora sul **lavoro agentic utile**, non solo sui benchmark accademici.
- **Collegamenti**: si inserisce nella corsa ai modelli di frontiera (Opus 4.8, Fable 5); segnale di mercato per i "modelli open weights cinesi" (cfr. le fiche su Qwen / MiniMax); rilevante per il dibattito sul **costo degli agenti** e sulla sovranità/self-hosting.

## RésuméDe400mots

Artificial Analysis — una piattaforma indipendente di valutazione di modelli AI — pubblica (thread X/Twitter del 22 giugno 2026 + una pagina dettagliata del modello) un confronto che colloca **GLM-5.2**, l'ultimo modello di **Z.ai** (Zhipu AI), in cima ai modelli **open weights** e al **#3 posto nella classifica generale** di **GDPval-AA**. Questo benchmark misura le prestazioni su **lavoro intellettuale reale ed economicamente rilevante**, attraverso **compiti multi-turno a lungo orizzonte** concepiti come esercizi professionali autentici (per esempio l'elenco dei compiti giornalieri di un supervisore di negozio al dettaglio, o un documento tecnico IEC) che coprono sia il lavoro professionale sia quello creativo.

GLM-5.2 raggiunge **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 in configurazione xhigh (1509)**. Soprattutto, domina il campo open con un **ampio margine**: il miglior modello open successivo, **MiniMax-M3**, ottiene solo **1408**. GLM-5.2 supera anche diversi modelli proprietari — **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)** e **Muse Spark (1158)**.

Viene sottolineata la natura **agentic** dei compiti: GLM-5.2 ha registrato in media **~31 turni per compito** su **1.999 confronti**. Il metodo di Artificial Analysis consiste nel fornire **brief identici** a GLM-5.2 e a tre modelli proprietari di frontiera (Fable 5, GPT-5.5, Gemini 3.5 Flash), per poi **rendere ogni output esattamente come prodotto**. Il risultato è coerente su tutti gli indici della società: GLM-5.2 è **#1 tra i modelli open weights** sull'**Intelligence Index**, **#3 sull'Agentic Index** e **#3 su AA-Briefcase** (dove è il miglior modello open, davanti a GPT-5.5 xhigh e dietro solo a Fable 5).

La pagina del modello completa il quadro: GLM-5.2 è una **Mixture of Experts** con **753 miliardi di parametri** (di cui **40 miliardi attivi**), un **modello di reasoning** con **contesto di 1M token**, distribuito con licenza **MIT** (uso commerciale, pesi su Hugging Face), rilasciato il **16 giugno 2026**. Sul piano economico: **1,40$ / 4,40$** per milione di token (input/output), un cache hit a **0,26$** (-81%), un throughput di **106,3 token/s** e un time to first token di **1,36 s**.

Il messaggio trasmesso dai numeri è chiaro: che un modello **open weights** a questo livello di prezzo rivaleggi con la frontiera proprietaria su un **lavoro agentic realmente utile** costituisce, secondo Artificial Analysis, *"un vero passo avanti per i modelli open"*. La convergenza tra modelli open e proprietari non si gioca più solo sui test accademici, ma sul valore economico prodotto in condizioni agentic.

## GrapheDeConnaissance

- Z.ai —a_créé→ GLM-5.2 (TECHNOLOGIE, 0.98)
- GLM-5.2 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- GLM-5.2 —remplace→ GLM-5.1 (TECHNOLOGIE, 0.95)
- GLM-5.2 —mesure→ 1524 Elo sur GDPval-AA (#3 au général, #1 open weights) (MESURE, 0.95)
- Claude Fable 5 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.92)
- Claude Opus 4.8 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.9)
- GLM-5.2 —surpasse→ MiniMax-M3 (TECHNOLOGIE, 0.92)
- GLM-5.2 —surpasse→ Gemini 3.5 Flash (TECHNOLOGIE, 0.88)
- GLM-5.2 —concurrence→ GPT-5.5 (TECHNOLOGIE, 0.85)
- GLM-5.2 —mesure→ ~31 tours par tâche sur 1 999 matchs (MESURE, 0.85)
- GDPval-AA —mesure→ travail de connaissance économiquement valorisable en tâches multi-tours longue-horizon (AFFIRMATION, 0.9)
- Artificial Analysis —publie→ GDPval-AA (DOCUMENT, 0.9)
- GLM-5.2 —est_instance_de→ modèle à poids ouverts (CONCEPT, 0.95)
- GLM-5.2 —utilise→ architecture Mixture of Experts (753 Mds params / 40 Mds actifs) (CONCEPT, 0.9)
- GLM-5.2 —mesure→ tarif 1,40 $ / 4,40 $ par 1M tokens (entrée/sortie) (MESURE, 0.9)
- Artificial Analysis —affirme_que→ qu'un modèle open weights rivalise avec la frontière propriétaire sur le travail agentique est un vrai progrès (AFFIRMATION, 0.85)

---
Canonical: https://www.thekb.eu/it/fiches/artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22/
