Vai al contenuto

METHODOLOGIE

GDPval

Benchmark che misura i modelli IA su compiti professionali di livello esperto — finanza, diritto, retail, software — valutati alla cieca da specialisti esperti. I punteggi riportati raggiungono il 40-49 % del livello esperto ma richiedono un'importante impostazione umana, al punto che la metrica stessa è giudicata sotto-specificata.

Origine

Introdotto da OpenAI nel 2025 come benchmark delle prestazioni dell'IA su compiti professionali di livello esperto in più ambiti.

definizione
Benchmark expert tasks — i modelli raggiungono il 40-49% del livello esperto umano, ma richiedono *extensive human framing* — la metrica stessa è sottospecificata
metodo
Esperti con 14 anni di esperienza, valutazione in cieco
portata
Finanza, diritto, retail, sviluppo software

Fiches (3)