Saltar al contenido

root / tags / z-ai

#Z.ai

5 fiches

Calidad y Seguridad Traducción verificada automáticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Publicación de anuncio publicada en el **blog oficial de Z.ai** (antes Zhipu AI, laboratorio chino) el **14 de agosto de 2026**, **sin firma individual**, ~2.000 palabras más notas al pie. Anuncia **GLM-5.3**, sucesor de GLM-5.2, y se abre con una tesis metodológica: *« Scaling post-training is all we did for GLM-5.3. »* Mismo modelo base que GLM-5.2 — *« every gain comes from post-training »*. Tres anuncios. **(A) Un modelo de codificación de pesos abiertos**: +50% reivindicado en **Z.ai Code Bench**, un benchmark interno no publicado. **(B) Una capacidad cibernética presentada como "emergente"**, que el cuerpo del texto atribuye a una decisión de entrenamiento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — lo que resultó sorprendente fue la velocidad y el cambio de naturaleza: el modelo pasa de identificar fallos aislados a *« coherent plans for complete exploitation chains »*. Las ganancias crecen con la posición en la cadena de explotación: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** tareas en 2h (×3,6), con una brecha frente a la frontera cerrada que sigue siendo amplia (181 y 247 tareas). Z.ai lo formula así: *« Capability is growing fastest exactly where we are furthest behind. »* La publicación también difunde un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilidades identificadas en 269 proyectos de código abierto** — núcleos, sistemas operativos, motores de navegador, infraestructura, aplicaciones web, protocolos de red — la más antigua introducida en **1981**, vida media antes del descubrimiento de **26,6 años**, de las cuales **53 divulgadas** y **2.383 bajo embargo**. **(C) Una publicación de los pesos** *« within two weeks of launch, once safety evaluation and hardening are complete »*. El aporte metodológico más reutilizable: la **síntesis de entornos y verificadores**, esta última producida sin acceso a la solución de referencia y admitida solo tras un tríptico de controles negativos — **oracle**, **no-op**, **unsolved-state**. Todas las evaluaciones agénticas se realizan **en Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Economía y Mercado Traducción verificada automáticamente

Mistral AI wants to build 1 gigawatt of European compute by 2030 — and lock in customers now.

Artículo de noticias analizado, publicado en **VentureBeat** el **11 de agosto de 2026** por **Michael Nuñez**, basado en una **entrevista exclusiva con Timothée Lacroix**, cofundador y CTO de **Mistral AI**, realizada antes del anuncio, ~2.000 palabras. Mistral amplía su oferta de infraestructura en tres partes: **Mistral Regional Endpoints** en disponibilidad general (fijando la inferencia y su procesamiento asociado en Europa o Estados Unidos), un **Priority Tier** en vista previa pública (niveles de servicio comprometidos, cuotas personalizadas, SLA de disponibilidad), y una **coalición de empresas europeas** cuyos compromisos plurianuales están destinados a financiar **200 MW para finales de 2027** y **1 GW para finales de 2030**. El vehículo se denomina **European Compute Unit (ECU)**: un derecho sobre capacidad construida por Mistral, fungible entre inferencia, entrenamiento, adaptación de modelos o Kubernetes gestionado, con un horizonte objetivo de cinco años. Lacroix describe el mecanismo sin rodeos — *"Todo el sentido de las unidades de cómputo es tener compromiso"* — y, sobre la salida anticipada: *"No hay salida posible."* El artículo pone en perspectiva la ambición: Mistral declara operar *"menos de 200 MW"* y detalla tres emplazamientos que suman **77 MW** (44 MW cerca de París, 23 MW en Suecia con EcoDataCenter, 10 MW en Les Ulis); **Epoch AI** cifra el capex inicial de un centro de datos de IA de un gigavatio en **~38.000 millones de dólares**, y **Goldman Sachs Research** cifra las instalaciones de nueva generación en **15-20 millones de dólares/MW sin chips**, frente a los **~4.000 millones de dólares** que Mistral ha recaudado en total (PitchBook). A esto se suma una decisión que *"probablemente levantará algunas cejas entre los puristas de la soberanía"*: Mistral empieza a **alojar modelos abiertos de terceros**, comenzando por **GLM-5.2** de **Z.ai**, un laboratorio chino — *"Es un modelo excelente. A todo el mundo le encanta. Tiene pesos abiertos, así que no había ninguna buena razón para no hacerlo."* El artículo examina la letra pequeña de la documentación de Mistral, que menciona *"transferencias limitadas y controladas"* a subcontratistas fuera de la región; presionado para dar detalles, Lacroix señala las **llamadas a herramientas**, en particular la búsqueda web, y afirma que **la restricción de acceso es la funcionalidad, no el fallo**. El enfoque del autor: *"el control regional total está disponible, pero en el momento en que un agente de IA accede a la web abierta, la soberanía se convierte en una decisión de configuración, no en un valor por defecto."* Quedan dos dependencias: las **GPU** provienen de Nvidia, y **Microsoft** — cliente ancla de los centros de datos europeos de Mistral desde julio — se presenta como lo que reduce el riesgo de la expansión.

#Mistral AI#soberanía digital#soberanía de la IA

**Michael Nuñez** — journaliste **VentureBeat** · couvre l'IA et l'infrastructure ; déjà présent au corpus. L'article est bâti sur un **entretien exclusif avec Timothée Lacroix** · cofondateur et CTO de Mistral AI · conduit **avant l'annonce** · et fait suite à un entretien de juin avec le même interlocuteur. Publié le **11 août 2026**.

Herramientas y Plataformas Traducción verificada automáticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Economía y Mercado Traducción verificada automáticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Anuncio de benchmark de **Artificial Analysis** (plataforma independiente de evaluación de modelos de IA, vía X/Twitter + página del modelo): **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) se convierte en **el modelo de pesos abiertos líder** y asciende al **puesto n.º 3 de la clasificación general** de **GDPval-AA**, un benchmark del mundo real para *trabajo intelectual económicamente valioso* (tareas de largo horizonte, multiturno, agénticas). GLM-5.2 obtiene **1524 Elo**, solo por detrás de **Claude Fable 5 (1783)** y **Claude Opus 4.8 (1615)**, y a la par de **GPT-5.5 (xhigh, 1509)**. Supera con amplio margen al siguiente mejor modelo de pesos abiertos (**MiniMax-M3, 1408**), así como a numerosos modelos propietarios: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Las tareas son genuinamente agénticas: **~31 turnos por tarea** de media en **1,999 enfrentamientos**. La misma clasificación se mantiene en el **Artificial Analysis Intelligence Index** (1.º entre los modelos de pesos abiertos), el **Agentic Index** (n.º 3) y **AA-Briefcase** (n.º 3, por delante de GPT-5.5 xhigh, solo por detrás de Fable 5). Dato destacado: un modelo de **pesos abiertos** bajo **licencia MIT**, **MoE con 753 mil millones de parámetros / 40 mil millones activos**, **contexto de 1M de tokens**, con un precio de **$1.40/$4.40 por 1M de tokens** de entrada/salida, rivaliza con la frontera propietaria en trabajo agéntico — un avance real para los modelos abiertos.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)

Agentes de codificación IA y Skills Traducción verificada automáticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

El editorial de Andrew Ng en The Batch #350 establece una **jerarquía de aceleración para agentes de codificación** por tipo de trabajo de software: **Frontend (máxima) > Backend (moderada) > Infraestructura (baja) > Investigación (mínima)**. El razonamiento se basa en la *verificabilidad* implícita (fluidez en TypeScript/JavaScript junto con un bucle autónomo de pruebas agente-navegador en el frontend) y en los puntos ciegos de los LLM (casos límite / seguridad / migraciones de bases de datos para el backend, compensaciones de red opacas para la infraestructura, formación irreducible de hipótesis para la investigación). El número se completa con 4 noticias estructurantes: **GLM-5.1 (Z.ai)**, un modelo con licencia MIT de 754B de parámetros (40B activos) capaz de tareas autónomas de hasta 8 horas de duración (líder de SWE-Bench Pro con 58,4%); **Digit (Agility Robotics) en Schaeffler**, el primer despliegue industrial de humanoides (1,75 m / 65 kg, 10-25 $/h frente a 20 $/h para un humano); la **revuelta antidata centers** (~64.000 M$ bloqueados entre mayo de 2024 y marzo de 2025, moratoria en Maine sobre instalaciones de 20MW o más, cóctel molotov en la casa de Sam Altman); y el **"eje del asistente"** (Christina Lu, MATS / Oxford / Anthropic), que reduce la deriva de persona y los jailbreaks (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) sin degradar IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités