Transformación y Adopción Traducción verificada automáticamente
METHODOLOGIE
GDPval
Benchmark que mide los modelos de IA en tareas profesionales de nivel experto — finanzas, derecho, retail, software — evaluadas a ciegas por especialistas experimentados. Las puntuaciones reportadas alcanzan el 40-49 % del nivel experto, pero exigen un encuadre humano considerable, por lo que la métrica en sí se considera subespecificada.
Origen
Introducido por OpenAI en 2025 como benchmark del rendimiento de la IA en tareas profesionales de nivel experto en varios ámbitos.
- definición
- Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada
- método
- Expertos con 14 años de experiencia, evaluación a ciegas
- alcance
- Finanzas, derecho, retail, desarrollo de software
Fiches (3)
Transformación y Adopción Traducción verificada automáticamente
After Automation
Economía y Mercado Traducción verificada automáticamente