Zum Inhalt springen
Methodik

GDPval

GDPval — Methodik. Definition: Benchmark expert tasks — Modelle erreichen 40-49% des menschlichen Expertenniveaus, benötigen jedoch *extensive human framing* — die Metrik selbst ist unterspezifiziert · Methode: Experten mit 14 Jahren Erfahrung, Blindbewertung · Umfang: Finanzen, Recht, Einzelhandel, Softwareentwicklung

Fachleute mit durchschnittlich 14 Jahren Erfahrung erstellen die Aufgaben: realistische Projekte, für die ein Mensch vier bis sieben Stunden benötigt. Mehrere KI-Modelle und menschliche Experten bearbeiten sie anschließend, und ein drittes Expertengremium bewertet die Ergebnisse blind, wobei es über eine Stunde pro Frage aufwendet. Ethan Mollick stellt dieses Design in einem Beitrag vom November 2025 MMLU-Pro und vergleichbaren Benchmarks gegenüber, deren öffentliche Lösungsschlüssel ins Training einsickern können und deren Fragen (etwa nach dem "durchschnittlichen Schädelvolumen des Homo erectus") etwas messen, das niemand benennen kann.

Die daraus resultierenden Werte weisen in zwei Richtungen. Jasmine Sun berichtet im April 2026 in der NYT über OpenAIs Benchmark, der 44 Berufe abdeckt und innerhalb weniger Monate eine Trefferquote von über 80% gegenüber menschlichen Fachkräften erreicht, und ordnet ihn in die Silicon-Valley-Debatte über den Verlust von Bürojobs ein. Dan Shipper zitiert einen Monat später einen Wert von 40 bis 49% des menschlichen Expertenniveaus und fügt die an diese Zahl geknüpfte Bedingung hinzu: umfangreiche menschliche Rahmensetzung. Die Metrik selbst ist unterspezifiziert.

Was die aufgabenweisen Ergebnisse zeigen, ist Uneinheitlichkeit statt einer einzigen Front. Mollick berichtet, dass KI Menschen in der Softwareentwicklung und Finanzberatung übertrifft, während Apotheker, Industrieingenieure und Immobilienmakler die KI übertreffen, und dass die Modelle voneinander abweichen: ChatGPT ist der bessere Vertriebsleiter, Claude der bessere Finanzberater.

So wird ein einziger Benchmark, der sich über Finanzen, Recht, Einzelhandel und Softwareentwicklung erstreckt, sowohl als Beweis dafür gelesen, dass die Modelle angekommen sind, als auch als Beweis dafür, dass jemand den Rahmen noch immer setzen muss.

Typ
Methodik
Definition
Benchmark expert tasks — Modelle erreichen 40-49% des menschlichen Expertenniveaus, benötigen jedoch *extensive human framing* — die Metrik selbst ist unterspezifiziert
Methode
Experten mit 14 Jahren Erfahrung, Blindbewertung
Umfang
Finanzen, Recht, Einzelhandel, Softwareentwicklung
Relationen
5
Zitiert in
3 fiches

Adoptionskennzahlen

Nachbarschaft

44 occupations humai… Jagged Frontier

→ misst

44 occupations humaines CONCEPT hohe Konfidenz stabil Quelle ↗
Jagged Frontier CONCEPT hohe Konfidenz stabil Quelle ↗

Zitiert in (3)