Aller au contenu
Méthodologie

GDPval

GDPval — Méthodologie. définition : Benchmark expert tasks — modèles atteignent 40-49% du niveau expert humain, mais nécessitent *extensive human framing* — la métrique elle-même est sous-spécifiée · méthode : Experts 14 ans d'expérience, évaluation en aveugle · portée : Finance, droit, retail, développement logiciel

Les experts, forts d'une expérience moyenne de 14 ans, construisent les tâches : des projets réalistes qu'un humain met de quatre à sept heures à accomplir. Plusieurs modèles d'IA et des experts humains les réalisent ensuite, et un second panel d'experts note les résultats en aveugle, en passant plus d'une heure par question. Ethan Mollick, dans un texte de novembre 2025, met cette conception en regard de MMLU-Pro et de ses semblables, dont les grilles de réponses publiques peuvent fuiter dans l'entraînement et dont les questions ("capacité crânienne moyenne d'Homo erectus ?") mesurent quelque chose que personne ne sait nommer.

Les scores qui en résultent pointent dans deux directions. Jasmine Sun, dans le NYT en avril 2026, rapporte que le benchmark d'OpenAI couvre 44 métiers et atteint plus de 80% de taux de victoire face à des professionnels humains en quelques mois, et le situe dans le débat de la Silicon Valley sur le remplacement des cols blancs. Dan Shipper, un mois plus tard, cite un niveau de 40 à 49% de l'expertise humaine, et ajoute la condition attachée à ce chiffre : un encadrement humain poussé. La métrique elle-même reste sous-spécifiée.

Ce que montrent les résultats tâche par tâche, c'est une hétérogénéité plutôt qu'une frontière unique. Mollick rapporte que l'IA bat les humains en développement logiciel et en conseil financier, tandis que les pharmaciens, les ingénieurs industriels et les agents immobiliers battent l'IA, et que les modèles divergent entre eux : ChatGPT meilleur directeur commercial, Claude meilleur conseiller financier.

Ainsi, un même benchmark, couvrant la finance, le droit, la distribution et le développement logiciel, se lit à la fois comme la preuve que les modèles sont arrivés à maturité et comme la preuve qu'il faut encore quelqu'un pour poser le cadre.

Type
Méthodologie
définition
Benchmark expert tasks — modèles atteignent 40-49% du niveau expert humain, mais nécessitent *extensive human framing* — la métrique elle-même est sous-spécifiée
méthode
Experts 14 ans d'expérience, évaluation en aveugle
portée
Finance, droit, retail, développement logiciel
relations
5
Citée dans
3 fiches

Mesures d'adoption

Voisinage

44 occupations humai… Jagged Frontier

→ mesure

44 occupations humaines CONCEPT confiance élevée stable Source ↗
Jagged Frontier CONCEPT confiance élevée stable Source ↗

Citée dans (3)