# artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22

## Veille

Anuncio de benchmark de **Artificial Analysis** (plataforma independiente de evaluación de modelos de IA, vía X/Twitter + página del modelo): **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) se convierte en **el modelo de pesos abiertos líder** y asciende al **puesto n.º 3 de la clasificación general** de **GDPval-AA**, un benchmark del mundo real para *trabajo intelectual económicamente valioso* (tareas de largo horizonte, multiturno, agénticas). GLM-5.2 obtiene **1524 Elo**, solo por detrás de **Claude Fable 5 (1783)** y **Claude Opus 4.8 (1615)**, y a la par de **GPT-5.5 (xhigh, 1509)**. Supera con amplio margen al siguiente mejor modelo de pesos abiertos (**MiniMax-M3, 1408**), así como a numerosos modelos propietarios: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Las tareas son genuinamente agénticas: **~31 turnos por tarea** de media en **1,999 enfrentamientos**. La misma clasificación se mantiene en el **Artificial Analysis Intelligence Index** (1.º entre los modelos de pesos abiertos), el **Agentic Index** (n.º 3) y **AA-Briefcase** (n.º 3, por delante de GPT-5.5 xhigh, solo por detrás de Fable 5). Dato destacado: un modelo de **pesos abiertos** bajo **licencia MIT**, **MoE con 753 mil millones de parámetros / 40 mil millones activos**, **contexto de 1M de tokens**, con un precio de **$1.40/$4.40 por 1M de tokens** de entrada/salida, rivaliza con la frontera propietaria en trabajo agéntico — un avance real para los modelos abiertos.

## Titre Article

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

## Date

2026-06-22

## URL

https://artificialanalysis.ai/models/glm-5-2

## Keywords

GLM-5.2, Z.ai, Zhipu AI, modelos de pesos abiertos, pesos abiertos, GDPval-AA, benchmark agéntico, trabajo intelectual, Elo, tareas multiturno, largo horizonte, Artificial Analysis Intelligence Index, Agentic Index, AA-Briefcase, Mixture of Experts, licencia MIT, contexto de 1M de tokens, razonamiento, coste por token, frontera propietaria, Claude Fable 5, MiniMax-M3

## Authors

Artificial Analysis (@ArtificialAnlys)

## Ton

Perfil: un anuncio de benchmark factual y basado en datos desde la perspectiva de un **evaluador independiente y tercero** (Artificial Analysis), difundido como un hilo de X/Twitter respaldado por una página detallada del modelo, registro neutro basado en datos en inglés, nivel técnico alto, dirigido a ingenieros de ML, responsables de decisiones técnicas, compradores de API y observadores del mercado de modelos fundacionales. El tono es el de una **comparación de rendimiento objetivada**: clasificaciones (Elo, índices), cifras precisas (1524, ~31 turnos, 1,999 enfrentamientos, $1.40/$4.40) y una metodología explícita (briefs idénticos dados a varios modelos, entregables renderizados tal cual). La autoridad se apoya en la **reputación de neutralidad** de Artificial Analysis y en la transparencia metodológica (renderizado de los entregables reales, multiplicidad de índices cruzados). La retórica, sin énfasis comercial, deja que las cifras porten la tesis implícita: la brecha entre modelos **abiertos** y **propietarios** se cierra en el terreno más exigente — el trabajo agéntico económicamente útil. Metáfora implícita: el benchmark como un "ejercicio profesional" (las tareas de un supervisor de tienda, etc.) en lugar de una prueba académica abstracta. El único juicio de valor explícito — *"un avance real para los modelos abiertos"* — es mesurado y se fundamenta en la relación precio/rendimiento.

## Pense-betes

- **Dato clave**: **GLM-5.2** (Z.ai / Zhipu AI) = **modelo de pesos abiertos n.º 1** y **n.º 3 general** en **GDPval-AA** con **1524 Elo**.
- **Podio de GDPval-AA**: 1. **Claude Fable 5 (1783)**; 2. **Claude Opus 4.8 (1615)**; 3. **GLM-5.2 (1524)** — a la par de **GPT-5.5 (xhigh, 1509)**.
- **Dominio en pesos abiertos**: el siguiente mejor modelo abierto, **MiniMax-M3**, se queda en solo **1408** (amplio margen).
- **Supera a modelos propietarios**: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**.
- **Qué mide GDPval-AA**: el rendimiento en **trabajo intelectual real y económicamente valioso**, mediante **tareas de largo horizonte y multiturno**; abarca tanto trabajo profesional COMO creativo (p. ej., la lista de tareas diarias de un supervisor de tienda minorista, un documento de la IEC…). Método: briefs idénticos dados a GLM-5.2 + 3 modelos propietarios de frontera (Fable 5, GPT-5.5, Gemini 3.5 Flash), **entregables renderizados tal como se produjeron**.
- **Genuinamente agéntico**: GLM-5.2 promedió **~31 turnos por tarea** en **1,999 enfrentamientos**.
- **Coherencia entre índices**: n.º 1 entre los modelos de pesos abiertos en el **Artificial Analysis Intelligence Index**, **n.º 3 en el Agentic Index**, **n.º 3 en AA-Briefcase** (en AA-Briefcase: mejor de pesos abiertos, por delante de GPT-5.5 xhigh, solo por detrás de Fable 5).
- **Especificaciones (página del modelo)**: **MoE de 753 000 millones de parámetros / 40 000 millones activos**, **modelo de razonamiento** (extended thinking), **contexto de 1M de tokens**, **texto a texto**, **licencia MIT** (uso comercial), pesos en Hugging Face, **lanzado el 16 de junio de 2026**.
- **Economía**: **$1.40 / $4.40** por 1M de tokens (entrada/salida), **acierto de caché $0.26** (-81%), tarifa combinada **~$0.90/1M**; rendimiento **106.3 tokens/s**, TTFT **1.36 s**; coste total de evaluación **$982.90**. → Argumento precio/rendimiento: frontera agéntica a precio de pesos abiertos.
- **Tesis implícita**: la convergencia entre modelos abiertos y propietarios se dirime ahora en el **trabajo agéntico útil**, no solo en benchmarks académicos.
- **Relacionado**: extiende la carrera de los modelos de frontera (Opus 4.8, Fable 5); señal de mercado para los "pesos abiertos chinos" (cf. fichas de Qwen / MiniMax); relevante para el debate sobre el **coste de los agentes** y la soberanía/autoalojamiento.

## RésuméDe400mots

Artificial Analysis — plataforma independiente de evaluación de modelos de IA — publica (hilo de X/Twitter del 22 de junio de 2026 + una página detallada del modelo) una comparación que sitúa a **GLM-5.2**, el último modelo de **Z.ai** (Zhipu AI), a la cabeza de los modelos de **pesos abiertos** y en el **puesto n.º 3 de la clasificación general** de **GDPval-AA**. Este benchmark mide el rendimiento en **trabajo intelectual real y económicamente valioso**, mediante **tareas de largo horizonte y multiturno** concebidas como auténticos ejercicios profesionales (por ejemplo, la lista de tareas diarias de un supervisor de tienda minorista, o un documento técnico de la IEC) que abarcan tanto trabajo profesional como creativo.

GLM-5.2 obtiene **1524 Elo**, solo por detrás de **Claude Fable 5 (1783)** y **Claude Opus 4.8 (1615)**, y a la par de **GPT-5.5 en configuración xhigh (1509)**. Sobre todo, domina el campo abierto por un **amplio margen**: el siguiente mejor modelo abierto, **MiniMax-M3**, obtiene solo **1408**. GLM-5.2 también supera a varios modelos propietarios: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)** y **Muse Spark (1158)**.

Se subraya la naturaleza **agéntica** de las tareas: GLM-5.2 promedió **~31 turnos por tarea** en **1,999 enfrentamientos**. El método de Artificial Analysis consiste en dar **briefs idénticos** a GLM-5.2 y a tres modelos propietarios de frontera (Fable 5, GPT-5.5, Gemini 3.5 Flash), y luego **renderizar cada entregable tal como se produjo**. El resultado es coherente en los propios índices de la firma: GLM-5.2 ocupa el **puesto n.º 1 entre los modelos de pesos abiertos** en el **Intelligence Index**, el **n.º 3 en el Agentic Index** y el **n.º 3 en AA-Briefcase** (donde es el mejor modelo de pesos abiertos, por delante de GPT-5.5 xhigh y solo por detrás de Fable 5).

La página del modelo completa el panorama: GLM-5.2 es un **Mixture of Experts** con **753 mil millones de parámetros** (de los cuales **40 mil millones activos**), un **modelo de razonamiento** con **contexto de 1M de tokens**, distribuido bajo **licencia MIT** (uso comercial, pesos en Hugging Face), lanzado el **16 de junio de 2026**. En el plano económico: **$1.40 / $4.40** por millón de tokens (entrada/salida), un acierto de caché a **$0.26** (-81%), un rendimiento de **106.3 tokens/s** y un tiempo hasta el primer token de **1.36 s**.

El mensaje que transmiten las cifras es claro: que un modelo de **pesos abiertos** con este precio rivalice con la frontera propietaria en **trabajo agéntico genuinamente útil** constituye, según Artificial Analysis, *«un avance real para los modelos abiertos»*. La convergencia entre modelos abiertos y propietarios ya no se dirime únicamente en pruebas académicas, sino en el valor económico producido en condiciones agénticas.

## GrapheDeConnaissance

- Z.ai —a_créé→ GLM-5.2 (TECHNOLOGIE, 0.98)
- GLM-5.2 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- GLM-5.2 —remplace→ GLM-5.1 (TECHNOLOGIE, 0.95)
- GLM-5.2 —mesure→ 1524 Elo sur GDPval-AA (#3 au général, #1 open weights) (MESURE, 0.95)
- Claude Fable 5 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.92)
- Claude Opus 4.8 —surpasse→ GLM-5.2 (TECHNOLOGIE, 0.9)
- GLM-5.2 —surpasse→ MiniMax-M3 (TECHNOLOGIE, 0.92)
- GLM-5.2 —surpasse→ Gemini 3.5 Flash (TECHNOLOGIE, 0.88)
- GLM-5.2 —concurrence→ GPT-5.5 (TECHNOLOGIE, 0.85)
- GLM-5.2 —mesure→ ~31 tours par tâche sur 1 999 matchs (MESURE, 0.85)
- GDPval-AA —mesure→ travail de connaissance économiquement valorisable en tâches multi-tours longue-horizon (AFFIRMATION, 0.9)
- Artificial Analysis —publie→ GDPval-AA (DOCUMENT, 0.9)
- GLM-5.2 —est_instance_de→ modèle à poids ouverts (CONCEPT, 0.95)
- GLM-5.2 —utilise→ architecture Mixture of Experts (753 Mds params / 40 Mds actifs) (CONCEPT, 0.9)
- GLM-5.2 —mesure→ tarif 1,40 $ / 4,40 $ par 1M tokens (entrée/sortie) (MESURE, 0.9)
- Artificial Analysis —affirme_que→ qu'un modèle open weights rivalise avec la frontière propriétaire sur le travail agentique est un vrai progrès (AFFIRMATION, 0.85)

---
Canonical: https://www.thekb.eu/es/fiches/artificial-analysis-glm-5-2-gdpval-aa-open-weights-2026-06-22/
