# artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22

## Veille

Benchmark-Ankündigung von **Artificial Analysis** (unabhängige Plattform zur Bewertung von KI-Modellen, via X/Twitter + Modellseite): **GLM-5.2** von **Z.ai** (Zhipu AI, @Zai_org) wird zum **führenden Open-Weights-Modell** und steigt auf **Platz 3 im Gesamtranking** von **GDPval-AA** auf, einem Real-World-Benchmark für *wirtschaftlich wertvolle Wissensarbeit* (long-horizon, multi-turn, agentische Aufgaben). GLM-5.2 erreicht **1524 Elo**, nur hinter **Claude Fable 5 (1783)** und **Claude Opus 4.8 (1615)**, und liegt gleichauf mit **GPT-5.5 (xhigh, 1509)**. Es führt mit deutlichem Abstand vor dem nächstbesten Open-Modell (**MiniMax-M3, 1408**) sowie vor zahlreichen proprietären Modellen: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Die Aufgaben sind tatsächlich agentisch: durchschnittlich **~31 Turns pro Aufgabe** über **1.999 Matches**. Dasselbe Ranking bestätigt sich im **Artificial Analysis Intelligence Index** (Platz 1 unter Open Weights), im **Agentic Index** (Platz 3) und bei **AA-Briefcase** (Platz 3, vor GPT-5.5 xhigh, nur hinter Fable 5). Bemerkenswert: Ein **Open-Weights**-Modell unter **MIT-Lizenz**, **MoE mit 753 Mrd. Parametern / 40 Mrd. aktiv**, **1M-Token-Kontext**, mit einem Preis von **1,40 $/4,40 $ pro 1M Tokens** (Input/Output), das bei agentischer Arbeit mit der proprietären Spitze konkurriert — ein echter Fortschritt für offene Modelle.

## Titre Article

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

## Date

2026-06-22

## URL

https://artificialanalysis.ai/models/glm-5-2

## Keywords

GLM-5.2, Z.ai, Zhipu AI, Open-Weights-Modelle, open weights, GDPval-AA, agentischer Benchmark, Wissensarbeit, Elo, Multi-Turn-Aufgaben, long-horizon, Artificial Analysis Intelligence Index, Agentic Index, AA-Briefcase, Mixture of Experts, MIT-Lizenz, 1M-Token-Kontext, Reasoning, Kosten pro Token, proprietäre Spitzenmodelle, Claude Fable 5, MiniMax-M3

## Authors

Artificial Analysis (@ArtificialAnlys)

## Ton

Profil: eine faktische, datengetriebene Benchmark-Ankündigung aus der Perspektive eines **unabhängigen Drittevaluators** (Artificial Analysis), verbreitet als X/Twitter-Thread mit unterstützender ausführlicher Modellseite, neutrales, datengetriebenes englisches Register, hohes technisches Niveau, adressiert an ML-Ingenieure, technische Entscheidungsträger, API-Käufer und Beobachter des Foundation-Model-Markts. Der Ton ist der eines **objektivierten Leistungsvergleichs**: Rankings (Elo, Indizes), präzise Zahlen (1524, ~31 Turns, 1.999 Matches, 1,40 $/4,40 $) und eine explizite Methodik (identische Briefings an mehrere Modelle, Ergebnisse unverändert dargestellt). Die Autorität stützt sich auf den **Ruf der Neutralität** von Artificial Analysis und auf methodische Transparenz (Darstellung der tatsächlichen Ergebnisse, Vielzahl gegengeprüfter Indizes). Die Rhetorik, frei von kommerzieller Betonung, lässt die Zahlen die implizite These tragen: Die Lücke zwischen **offenen** und **proprietären** Modellen schließt sich auf dem anspruchsvollsten Terrain — wirtschaftlich nützlicher agentischer Arbeit. Implizite Metapher: der Benchmark als „berufliche Übung“ (Aufgaben eines Filialleiters usw.) statt als abstrakter akademischer Test. Das einzige explizite Werturteil — *"a real step for open models"* — ist maßvoll und im Preis-Leistungs-Verhältnis begründet.

## Pense-betes

- **Kernfakt**: **GLM-5.2** (Z.ai / Zhipu AI) = **führendes Open-Weights-Modell** und **Platz 3 gesamt** bei **GDPval-AA** mit **1524 Elo**.
- **GDPval-AA-Podium**: 1. **Claude Fable 5 (1783)**; 2. **Claude Opus 4.8 (1615)**; 3. **GLM-5.2 (1524)** — gleichauf mit **GPT-5.5 (xhigh, 1509)**.
- **Dominanz bei Open Weights**: Das nächstbeste Open-Modell, **MiniMax-M3**, liegt nur bei **1408** (deutlicher Abstand).
- **Übertrifft proprietäre Modelle**: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**.
- **Was GDPval-AA misst**: Leistung bei **realer, wirtschaftlich wertvoller Wissensarbeit**, über **long-horizon, multi-turn Aufgaben**; deckt sowohl berufliche ALS AUCH kreative Arbeit ab (z. B. die tägliche Aufgabenliste eines Filialleiters im Einzelhandel, ein IEC-Dokument …). Methode: identische Briefings an GLM-5.2 + 3 proprietäre Spitzenmodelle (Fable 5, GPT-5.5, Gemini 3.5 Flash), **Ergebnisse genau so dargestellt, wie sie erzeugt wurden**.
- **Wirklich agentisch**: GLM-5.2 benötigte durchschnittlich **~31 Turns pro Aufgabe** über **1.999 Matches**.
- **Konsistenz über die Indizes hinweg**: Platz 1 unter Open Weights im **Artificial Analysis Intelligence Index**, **Platz 3 im Agentic Index**, **Platz 3 bei AA-Briefcase** (bei AA-Briefcase: führendes Open-Weights-Modell, vor GPT-5.5 xhigh, nur hinter Fable 5).
- **Spezifikationen (Modellseite)**: **MoE 753 Mrd. Parameter / 40 Mrd. aktiv**, **Reasoning-Modell** (erweitertes Denken), **1M-Token-Kontext**, **Text-zu-Text**, **MIT-Lizenz** (kommerzielle Nutzung), Gewichte auf Hugging Face, **veröffentlicht am 16. Juni 2026**.
- **Wirtschaftlichkeit**: **1,40 $ / 4,40 $** pro 1M Tokens (Input/Output), **Cache-Hit 0,26 $** (-81 %), Mischsatz **~0,90 $/1M**; Durchsatz **106,3 Tokens/s**, TTFT **1,36 s**; Gesamtkosten der Evaluierung **982,90 $**. → Preis-Leistungs-Argument: agentische Spitzenleistung zu Open-Weights-Preisen.
- **Implizite These**: Die Konvergenz zwischen offenen und proprietären Modellen spielt sich nun bei **nützlicher agentischer Arbeit** ab, nicht mehr nur bei akademischen Benchmarks.
- **Verwandt**: erweitert das Rennen der Spitzenmodelle (Opus 4.8, Fable 5); Marktsignal für „chinesische Open-Weights“-Modelle (vgl. Qwen-/MiniMax-Fiches); relevant für die Debatte um **Agentenkosten** und Souveränität/Self-Hosting.

## RésuméDe400mots

Artificial Analysis — eine unabhängige Plattform zur Bewertung von KI-Modellen — veröffentlicht (X/Twitter-Thread vom 22. Juni 2026 + eine ausführliche Modellseite) einen Vergleich, der **GLM-5.2**, das neueste Modell von **Z.ai** (Zhipu AI), an die Spitze der **Open-Weights**-Modelle und auf **Platz 3 im Gesamtranking** von **GDPval-AA** setzt. Dieser Benchmark misst die Leistung bei **realer, wirtschaftlich wertvoller Wissensarbeit** anhand von **long-horizon, multi-turn Aufgaben**, die als echte berufliche Übungen konzipiert sind (zum Beispiel die tägliche Aufgabenliste eines Filialleiters im Einzelhandel oder ein technisches IEC-Dokument) und sowohl berufliche als auch kreative Arbeit abdecken.

GLM-5.2 erzielt **1524 Elo**, nur hinter **Claude Fable 5 (1783)** und **Claude Opus 4.8 (1615)**, und liegt gleichauf mit **GPT-5.5 in der xhigh-Einstellung (1509)**. Vor allem dominiert es das offene Feld mit **deutlichem Abstand**: Das nächstbeste Open-Modell, **MiniMax-M3**, erreicht nur **1408**. GLM-5.2 übertrifft zudem mehrere proprietäre Modelle — **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)** und **Muse Spark (1158)**.

Der **agentische** Charakter der Aufgaben wird hervorgehoben: GLM-5.2 benötigte im Durchschnitt **~31 Turns pro Aufgabe** über **1.999 Matches**. Die Methode von Artificial Analysis besteht darin, **identische Briefings** an GLM-5.2 und drei proprietäre Spitzenmodelle (Fable 5, GPT-5.5, Gemini 3.5 Flash) zu geben und anschließend **jedes Ergebnis genau so darzustellen, wie es erzeugt wurde**. Das Ergebnis ist über die eigenen Indizes des Unternehmens hinweg konsistent: GLM-5.2 belegt **Platz 1 unter den Open-Weights**-Modellen im **Intelligence Index**, **Platz 3 im Agentic Index** und **Platz 3 bei AA-Briefcase** (wo es das führende Open-Modell ist, vor GPT-5.5 xhigh und nur hinter Fable 5).

Die Modellseite ergänzt das Bild: GLM-5.2 ist ein **Mixture of Experts** mit **753 Milliarden Parametern** (davon **40 Milliarden aktiv**), ein **Reasoning-Modell** mit **1M-Token-Kontext**, das unter **MIT-Lizenz** vertrieben wird (kommerzielle Nutzung, Gewichte auf Hugging Face), veröffentlicht am **16. Juni 2026**. Zur Wirtschaftlichkeit: **1,40 $ / 4,40 $** pro Million Tokens (Input/Output), ein Cache-Hit zu **0,26 $** (-81 %), ein Durchsatz von **106,3 Tokens/s** und eine Time to First Token von **1,36 s**.

Die durch die Zahlen vermittelte Botschaft ist klar: Dass ein **Open-Weights**-Modell zu diesem Preis mit der proprietären Spitze bei **wirklich nützlicher agentischer Arbeit** konkurriert, stellt laut Artificial Analysis *"einen echten Schritt für offene Modelle"* dar. Die Konvergenz zwischen offenen und proprietären Modellen spielt sich nicht mehr allein auf akademischen Tests ab, sondern beim unter agentischen Bedingungen erzeugten wirtschaftlichen Wert.

## GrapheDeConnaissance

- Z.ai —a_créé→ GLM-5.2 (TECHNOLOGIE, 0.98)
- GLM-5.2 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- GLM-5.2 —remplace→ GLM-5.1 (TECHNOLOGIE, 0.95)
- GLM-5.2 —mesure→ 1524 Elo sur GDPval-AA (#3 au général, #1 open weights) (MESURE, 0.95)
- Claude Fable 5 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.92)
- Claude Opus 4.8 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.9)
- GLM-5.2 —surpasse→ MiniMax-M3 (TECHNOLOGIE, 0.92)
- GLM-5.2 —surpasse→ Gemini 3.5 Flash (TECHNOLOGIE, 0.88)
- GLM-5.2 —concurrence→ GPT-5.5 (TECHNOLOGIE, 0.85)
- GLM-5.2 —mesure→ ~31 tours par tâche sur 1 999 matchs (MESURE, 0.85)
- GDPval-AA —mesure→ travail de connaissance économiquement valorisable en tâches multi-tours longue-horizon (AFFIRMATION, 0.9)
- Artificial Analysis —publie→ GDPval-AA (DOCUMENT, 0.9)
- GLM-5.2 —est_instance_de→ modèle à poids ouverts (CONCEPT, 0.95)
- GLM-5.2 —utilise→ architecture Mixture of Experts (753 Mds params / 40 Mds actifs) (CONCEPT, 0.9)
- GLM-5.2 —mesure→ tarif 1,40 $ / 4,40 $ par 1M tokens (entrée/sortie) (MESURE, 0.9)
- Artificial Analysis —affirme_que→ qu'un modèle open weights rivalise avec la frontière propriétaire sur le travail agentique est un vrai progrès (AFFIRMATION, 0.85)

---
Canonical: https://www.thekb.eu/de/fiches/artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22/
