Transformation & Adoption Automatisch geprüfte Übersetzung
METHODOLOGIE
GDPval
Benchmark, der KI-Modelle bei beruflichen Aufgaben auf Expertenniveau misst — Finanzen, Recht, Einzelhandel, Software —, blind bewertet von erfahrenen Fachleuten. Die berichteten Werte erreichen 40-49 % des Expertenniveaus, erfordern aber erhebliche menschliche Rahmensetzung, sodass die Metrik selbst als unterspezifiziert gilt.
Herkunft
Von OpenAI 2025 eingeführt als Benchmark für die KI-Leistung bei fachlichen Aufgaben auf Expertenniveau in mehreren Domänen.
- Definition
- Benchmark expert tasks — Modelle erreichen 40-49% des menschlichen Expertenniveaus, benötigen jedoch *extensive human framing* — die Metrik selbst ist unterspezifiziert
- Methode
- Experten mit 14 Jahren Erfahrung, Blindbewertung
- Umfang
- Finanzen, Recht, Einzelhandel, Softwareentwicklung
Fiches (3)
Transformation & Adoption Automatisch geprüfte Übersetzung
After Automation
Wirtschaft & Markt Automatisch geprüfte Übersetzung