Zum Inhalt springen

METHODOLOGIE

GDPval

Benchmark, der KI-Modelle bei beruflichen Aufgaben auf Expertenniveau misst — Finanzen, Recht, Einzelhandel, Software —, blind bewertet von erfahrenen Fachleuten. Die berichteten Werte erreichen 40-49 % des Expertenniveaus, erfordern aber erhebliche menschliche Rahmensetzung, sodass die Metrik selbst als unterspezifiziert gilt.

Herkunft

Von OpenAI 2025 eingeführt als Benchmark für die KI-Leistung bei fachlichen Aufgaben auf Expertenniveau in mehreren Domänen.

Definition
Benchmark expert tasks — Modelle erreichen 40-49% des menschlichen Expertenniveaus, benötigen jedoch *extensive human framing* — die Metrik selbst ist unterspezifiziert
Methode
Experten mit 14 Jahren Erfahrung, Blindbewertung
Umfang
Finanzen, Recht, Einzelhandel, Softwareentwicklung

Fiches (3)