# mollick-giving-ai-job-interview-2025-11-12

## Veille

Benchmarking de IA más allá de los tests estándar - Entrevistar a modelos de IA para casos de uso específicos - Jagged Frontier - OpenAI GDPval - Vibes frente a mediciones reales - Ejemplo GuacaDrone - Ethan Mollick - One Useful Thing

## Titre Article

Giving your AI a Job Interview

## Date

2025-11-12

## URL

https://www.oneusefulthing.org/p/giving-your-ai-a-job-interview

## Keywords

benchmarking de IA, MMLU-Pro, ARC-AGI, METR Long Tasks, limitaciones de los benchmarks, testing basado en vibes, OpenAI GDPval, tareas del mundo real, Jagged Frontier, evaluación de modelos, GuacaDrone, evaluación de riesgos, nutria en un avión, pelícano en bicicleta, Simon Willison, Claude 4.5 Sonnet, GPT-5 Thinking, Gemini 2.5 Pro, Kimi K2 Thinking, Grok, Microsoft Copilot, personalidad de los modelos, asesoramiento a escala, analogía de la entrevista de trabajo, evaluación experta, selección de modelos, adopción organizacional de IA, rendimiento específico por tarea, diferencias de juicio

## Authors

Ethan Mollick

## Ton

**Perfil:** Educador-practicante | Primera persona pedagógica | Analítico-prescriptivo | Accesible-intermedio

Mollick adopta la voz de un educador que combina rigor analítico con accesibilidad pragmática. La estructura pedagógica progresiva (problema de los benchmarks → solución "vibes" → solución del mundo real → acción prescriptiva) es típica de One Useful Thing. Los ejemplos lúdicos (nutrias en aviones, GuacaDrone, pelícano en bicicleta) hacen tangibles conceptos abstractos sin sacrificar profundidad. El tono equilibrado reconoce limitaciones ("algunos problemas", "no es fácil") a la vez que ofrece soluciones accionables ("vas a necesitar entrevistar a tu IA"). Las citas de datos empíricos (gráficos de Epoch AI, el paper GDPval) aportan credibilidad. Las analogías empresariales (contratar a un vicepresidente, entrevista de trabajo) conectan la adopción de IA con prácticas de gestión familiares. Típico del estilo de Mollick (profesor de Wharton y bloguero accesible) que desmitifica la complejidad técnica para una audiencia de profesionales.

## Pense-betes

- **Paradoja del benchmarking**: es "sorprendentemente difícil medir con exactitud lo 'inteligentes' que son"
- **Problemas de los benchmarks estándar**:
- Claves de respuestas públicas → incorporadas al entrenamiento (por accidente o para inflar puntuaciones)
- Se desconoce qué miden realmente los tests (MMLU-Pro: "¿capacidad craneal media del Homo erectus?", "¿álbum en directo de 1979 de Cheap Trick?")
- Los tests no están calibrados: ¿pasar del 84% al 85% es tan difícil como pasar del 40% al 41%?
- Puntuación máxima inalcanzable (errores en las preguntas, reporte inusual)
- **Valor colectivo**: todos los benchmarks tienden "hacia arriba y hacia la derecha" (AIME, GPQA, MMLU, SWE-bench, LiveBench, Terminal-Bench, ARC-AGI, METR Long Tasks)
- **Factor de capacidad subyacente**: correlacionado con el impacto en el mundo real, desde la medicina hasta las finanzas
- **Brecha de los benchmarks**: centrados en matemáticas, ciencia, razonamiento, código — no en escritura, análisis sociológico, asesoramiento empresarial, empatía
- **Cita clave**: "Lo que realmente te importa es qué modelo sería mejor para TUS necesidades" **Benchmarking "basado en vibes"**
- **Simon Willison**: test del pelícano en bicicleta
- **Tests de Mollick**: nutria en un avión, panel de control de nave espacial en JavaScript, poema difícil, videojuegos/shaders, análisis de artículos, escritura sobre viajes en el tiempo
- **Preguntas planteadas**: ¿Comete errores? ¿Las respuestas se parecen a las de otros modelos? ¿Temas/sesgos recurrentes?
- **Ejercicio de escritura**: "Alguien racionaliza las palabras restantes como suministros de guerra, y te dicen que te quedan 10.000 para toda la vida. A las 47 palabras, sostienes a un recién nacido".
- **Patrones de resultados**:
- Claude 4.5 Sonnet: modelo de escritura sólido
- Gemini 2.5 Pro: no lleva la cuenta del número de palabras (actualmente el más débil)
- GPT-5 Thinking: estilista exuberante, metáforas complejas, a veces incoherente
- Kimi K2 Thinking: giros interesantes, pero la historia no tiene sentido
- **Límites de los vibes**: idiosincrásicos, respuestas distintas cada vez, mejores prompts = mejores resultados, apoyarse en impresiones en lugar de mediciones **Benchmarking en el mundo real: OpenAI GDPval**
- **Paso 1**: expertos (14 años de experiencia de media: finanzas, derecho, retail) crean proyectos realistas y complejos que representan de 4 a 7 horas de trabajo humano
- **Paso 2**: varios modelos de IA + expertos humanos (pagados por hora) realizan las tareas
- **Paso 3**: un tercer grupo de expertos evalúa los resultados a ciegas (se desconoce si es IA o humano), dedicando más de una hora por pregunta
- **Puntos fuertes**: los mejores modelos superan a los humanos en desarrollo de software y asesoramiento financiero personal
- **Debilidades**: farmacéuticos, ingenieros industriales y agentes inmobiliarios superan fácilmente a la IA
- **Diferencias entre modelos**: ChatGPT mejor gestor de ventas, Claude mejor asesor financiero
- **Revela la forma de la Jagged Frontier** y cómo evoluciona con el tiempo **El experimento GuacaDrone**
- **Pitch**: una idea dudosa — entrega de guacamole por dron
- **Método**: cada modelo de IA valora la viabilidad de 1 a 10, diez veces cada uno (las respuestas varían cada vez)
- **Resultados**:
- Grok: gran idea (entusiasta)
- Microsoft Copilot: emocionado
- GPT-5 y Claude 4.5: más escépticos
- Mollick personalmente: le daría un 2 o menos
- **Implicación**: "Puntuar sistemáticamente las ideas 3-4 puntos más alto o más bajo significa orientarte sistemáticamente en una dirección distinta"
- **Impacto empresarial**: unos quieren una IA que abrace el riesgo, otros una que lo evite — entender cómo "piensa" la IA sobre cuestiones críticas es esencial **La prescripción de "entrevista a tu modelo"**
- **Individuos**: los vibes bastan, hacer el test de la nutria (ahora se ha vuelto demasiado fácil — actualizado a "metraje de documental de los años 60 sobre el último concierto famoso antes del incidente de la manada de nutrias" en Sora 2)
- **Organizaciones a gran escala**: un desafío distinto
- "El mejor" no basta para miles de tareas y cientos de empleados
- Hay que saber específicamente en qué es buena TU IA, no de media
- GDPval lo reveló: el rendimiento de los mejores modelos varía significativamente según la tarea
- GuacaDrone: juicio sobre preguntas ambiguas, consejos sistemáticamente diferentes
- Las diferencias se acumulan a escala
- **No confiar en**: ni los vibes ni los benchmarks generales
- **Qué hacer**:
- Probar sistemáticamente la IA en el trabajo real que hará y los juicios reales que emitirá
- Crear escenarios realistas que reflejen los casos de uso reales
- Ejecutar varias veces para ver los patrones
- Hacer que los resultados sean evaluados por expertos
- Comparar modelos cara a cara en las tareas que importan
- "La diferencia entre 'este modelo obtuvo un 85% en MMLU' y 'este modelo es más preciso en nuestras tareas de análisis financiero pero más conservador en la evaluación de riesgos'"
- Varias veces al año, a medida que se publican nuevos modelos
- **Analogía final**: "No contratarías a un vicepresidente basándote únicamente en su puntuación del SAT. No deberías elegir una IA que asesorará miles de decisiones por el hecho de que sabe que la capacidad craneal media del Homo erectus es algo menos de 1.000 centímetros cúbicos".

## RésuméDe400mots

Ethan Mollick sostiene que, pese al progreso medible en IA, los benchmarks estándar no logran capturar lo que realmente importa: el rendimiento en TUS tareas específicas con TUS criterios de juicio. Propone "entrevistar" a los modelos de IA como si fueran candidatos a un puesto, en lugar de basarse en puntuaciones de tests genéricos.

**Problemas de los benchmarks estándar**

Benchmarks como MMLU-Pro plantean preguntas oscuras ("¿capacidad craneal media del Homo erectus?", "¿título del álbum en directo de 1979 de Cheap Trick?") cuyo valor real de medición no está claro. Los tests no están calibrados (se desconoce si pasar del 84% al 85% es tan difícil como pasar del 40% al 41%), contienen errores, y las puntuaciones máximas pueden ser inalcanzables. Peor aún: las claves de respuestas públicas permiten su incorporación al entrenamiento (por accidente o de forma deliberada). En conjunto, todos los benchmarks (AIME, GPQA, MMLU, SWE-bench, ARC-AGI, METR) tienden "hacia arriba y hacia la derecha", midiendo un factor de capacidad subyacente correlacionado con el impacto en el mundo real. Pero su enfoque en matemáticas, ciencia, razonamiento y código deja huecos en escritura, asesoramiento empresarial y empatía. "Lo que realmente te importa es qué modelo sería mejor para TUS necesidades".

**Benchmarking "basado en vibes": un enfoque individual**

Los profesionales desarrollan tests idiosincrásicos: Simon Willison pide un pelícano en bicicleta, Mollick una nutria en un avión, un panel de control de nave espacial en JavaScript, poemas difíciles, videojuegos. Un ejercicio de escritura revela patrones: Claude 4.5 Sonnet es un escritor sólido, Gemini 2.5 Pro (actualmente el más débil) no lleva la cuenta del número de palabras, GPT-5 Thinking es un estilista exuberante a veces incoherente, Kimi K2 Thinking produce giros interesantes pero una historia que no tiene sentido. Los vibes dan una "sensación" de los modelos, pero siguen siendo idiosincrásicos: las respuestas varían cada vez y uno se apoya en impresiones en lugar de mediciones reales.

**Benchmarking en el mundo real: el método GDPval**

El paper GDPval de OpenAI demuestra un enfoque riguroso: (1) expertos con 14 años de experiencia de media crean proyectos realistas y complejos que representan de 4 a 7 horas de trabajo humano, (2) varios modelos de IA y expertos humanos realizan las tareas, (3) un tercer grupo de expertos evalúa a ciegas, dedicando más de una hora por pregunta. El estudio revela los puntos fuertes de la IA (desarrollo de software, asesoramiento financiero: supera a los humanos) y sus debilidades (farmacéuticos, ingenieros industriales, agentes inmobiliarios superan a la IA). Surgen diferencias entre modelos: ChatGPT es mejor gestor de ventas, Claude mejor asesor financiero. La forma de la "Jagged Frontier" toma cuerpo.

**GuacaDrone revela la personalidad de los modelos**

Mollick presenta una idea dudosa, "entrega de guacamole por dron", y pide a los modelos que valoren su viabilidad de 1 a 10, diez veces cada uno. Grok se muestra entusiasta, Copilot emocionado, GPT-5 y Claude escépticos. El propio Mollick le daría un 2 o menos. "Puntuar sistemáticamente las ideas 3-4 puntos más alto o más bajo significa orientarte sistemáticamente en una dirección distinta". Según la empresa, se quiere una IA que abrace o evite el riesgo: es necesario entender cómo "piensa" la IA sobre cuestiones críticas.

**Prescripción para las organizaciones**

Los vibes bastan para los individuos. Las organizaciones que despliegan a gran escala necesitan pruebas sistemáticas: IA sobre trabajo real y juicios reales, escenarios realistas, ejecutados varias veces, evaluados por expertos, con comparación directa en las tareas que importan. "La diferencia entre 'el modelo obtuvo un 85% en MMLU' y 'el modelo es más preciso en análisis financiero pero más conservador en riesgo'". Hay que repetirlo varias veces al año a medida que se publican nuevos modelos.

Analogía final: "No contratarías a un vicepresidente basándote únicamente en su puntuación del SAT. No elijas la IA que asesorará miles de decisiones basándote en su conocimiento de la capacidad craneal media del Homo erectus".

## GrapheDeConnaissance

- Ethan Mollick —publie→ Giving your AI a Job Interview (DOCUMENT, 0.99)
- Ethan Mollick —recommande→ interviewer modèles IA sur tâches réelles (METHODOLOGIE, 0.98)
- Ethan Mollick —affirme_que→ les benchmarks standards échouent à mesurer la performance tâche-spécifique (AFFIRMATION, 0.95)
- questions de valeur incertaine —fait_partie_de→ MMLU-Pro (TECHNOLOGIE, 0.92)
- OpenAI —publie→ GDPval paper (DOCUMENT, 0.97)
- GDPval —mesure→ Jagged Frontier (CONCEPT, 0.95)
- Claude 4.5 Sonnet —surpasse→ autres modèles en écriture (TECHNOLOGIE, 0.88)
- Claude —surpasse→ ChatGPT en conseil financier (TECHNOLOGIE, 0.87)
- biais pro-risque dans évaluation idées —observé_dans→ Grok (TECHNOLOGIE, 0.9)
- Simon Willison —utilise→ test pelican sur vélo (METHODOLOGIE, 0.95)
- Ethan Mollick —utilise→ test loutre sur avion (METHODOLOGIE, 0.95)
- Ethan Mollick —affirme_que→ le vibes-based testing est insuffisant pour les organisations déployant l'IA à grande échelle (AFFIRMATION, 0.93)
- GDPval —mesure→ différences significatives de performance entre modèles par tâche (MESURE, 0.96)

---
Canonical: https://www.thekb.eu/es/fiches/mollick-giving-ai-job-interview-2025-11-12/
