Saltar al contenido

root / tags / mmlu-pro

#MMLU-Pro

3 fiches

Agentes de codificación IA y Skills Traducción verificada automáticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

El editorial de Andrew Ng en The Batch #350 establece una **jerarquía de aceleración para agentes de codificación** por tipo de trabajo de software: **Frontend (máxima) > Backend (moderada) > Infraestructura (baja) > Investigación (mínima)**. El razonamiento se basa en la *verificabilidad* implícita (fluidez en TypeScript/JavaScript junto con un bucle autónomo de pruebas agente-navegador en el frontend) y en los puntos ciegos de los LLM (casos límite / seguridad / migraciones de bases de datos para el backend, compensaciones de red opacas para la infraestructura, formación irreducible de hipótesis para la investigación). El número se completa con 4 noticias estructurantes: **GLM-5.1 (Z.ai)**, un modelo con licencia MIT de 754B de parámetros (40B activos) capaz de tareas autónomas de hasta 8 horas de duración (líder de SWE-Bench Pro con 58,4%); **Digit (Agility Robotics) en Schaeffler**, el primer despliegue industrial de humanoides (1,75 m / 65 kg, 10-25 $/h frente a 20 $/h para un humano); la **revuelta antidata centers** (~64.000 M$ bloqueados entre mayo de 2024 y marzo de 2025, moratoria en Maine sobre instalaciones de 20MW o más, cóctel molotov en la casa de Sam Altman); y el **"eje del asistente"** (Christina Lu, MATS / Oxford / Anthropic), que reduce la deriva de persona y los jailbreaks (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) sin degradar IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités

Calidad y Seguridad Traducción verificada automáticamente

Playing Pretend: Expert Personas Don't Improve Factual Accuracy

Estudio de Wharton (Generative AI Labs): las personas expertas no mejoran la precisión factual de los LLM - benchmarks GPQA Diamond y MMLU-Pro - SSRN

#prompting de IA#personas#precisión de LLM

Savir Basil · Ina Shapiro · Dan Shapiro · Ethan Mollick · Lilach Mollick · Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)

Transformación y Adopción Traducción verificada automáticamente

Giving your AI a Job Interview

Benchmarking de IA más allá de los tests estándar - Entrevistar a modelos de IA para casos de uso específicos - Jagged Frontier - OpenAI GDPval - Vibes frente a mediciones reales - Ejemplo GuacaDrone - Ethan Mollick - One Useful Thing

#benchmarking de IA#MMLU-Pro#ARC-AGI

Ethan Mollick