GDPval
GDPval — Metodología. definición: Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada · método: Expertos con 14 años de experiencia, evaluación a ciegas · alcance: Finanzas, derecho, retail, desarrollo de software
Los expertos, con una media de 14 años de experiencia, elaboran las tareas: proyectos realistas que a un humano le llevan de cuatro a siete horas. Varios modelos de IA y expertos humanos los completan a continuación, y un tercer panel de expertos evalúa los resultados a ciegas, dedicando más de una hora por pregunta. Ethan Mollick, en noviembre de 2025, contrasta este diseño con MMLU-Pro y sus semejantes, cuyas claves de respuestas públicas pueden filtrarse al entrenamiento y cuyas preguntas ("capacidad craneal media del Homo erectus?") miden algo que nadie sabe nombrar.
Las puntuaciones que arroja apuntan en dos direcciones. Jasmine Sun, en el NYT en abril de 2026, informa de que el benchmark de OpenAI cubre 44 profesiones y alcanza una tasa de victoria superior al 80% frente a profesionales humanos en cuestión de meses, y lo sitúa dentro del debate de Silicon Valley sobre el desplazamiento del trabajo de cuello blanco. Dan Shipper, un mes después, cita entre el 40 y el 49% del nivel de un experto humano, y añade la condición asociada a esa cifra: un extenso encuadre humano. La métrica en sí está poco especificada.
Lo que muestran los resultados tarea por tarea es desigualdad más que una frontera única. Mollick informa de que la IA supera a los humanos en desarrollo de software y asesoramiento financiero, mientras que farmacéuticos, ingenieros industriales y agentes inmobiliarios superan a la IA, y de que los modelos divergen entre sí: ChatGPT es el mejor director de ventas, Claude el mejor asesor financiero.
Así, un mismo benchmark, que abarca finanzas, derecho, comercio minorista y desarrollo de software, se lee a la vez como prueba de que los modelos han llegado y como prueba de que alguien todavía tiene que fijar el marco.
- Tipo
- Metodología
- definición
- Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada
- método
- Expertos con 14 años de experiencia, evaluación a ciegas
- alcance
- Finanzas, derecho, retail, desarrollo de software
- relaciones
- 5
- Citada en
- 3 fiches