# mollick-giving-ai-job-interview-2025-11-12

## Veille

Benchmark AI oltre i test standard - Intervistare i modelli AI per casi d'uso specifici - Jagged Frontier - OpenAI GDPval - Vibes vs misurazioni reali - Esempio GuacaDrone - Ethan Mollick - One Useful Thing

## Titre Article

Giving your AI a Job Interview

## Date

2025-11-12

## URL

https://www.oneusefulthing.org/p/giving-your-ai-a-job-interview

## Keywords

AI benchmarking, MMLU-Pro, ARC-AGI, METR Long Tasks, limiti dei benchmark, vibes-based testing, OpenAI GDPval, compiti nel mondo reale, Jagged Frontier, valutazione dei modelli, GuacaDrone, valutazione del rischio, lontra sull'aereo, pellicano in bicicletta, Simon Willison, Claude 4.5 Sonnet, GPT-5 Thinking, Gemini 2.5 Pro, Kimi K2 Thinking, Grok, Microsoft Copilot, personalità del modello, consulenza su larga scala, analogia del colloquio di lavoro, valutazione da parte di esperti, selezione del modello, adozione dell'IA nelle organizzazioni, prestazioni specifiche per compito, differenze di giudizio

## Authors

Ethan Mollick

## Ton

**Profilo:** Professionista-educatore | Prima persona pedagogica | Analitico-prescrittivo | Accessibile-intermedio

Mollick adotta la voce di un educatore che unisce rigore analitico e accessibilità pragmatica. La struttura pedagogica progressiva (problema dei benchmark → soluzione "vibes" → soluzione nel mondo reale → azione prescrittiva) è tipica di One Useful Thing. Esempi giocosi (lontre su aerei, GuacaDrone, pellicano in bicicletta) rendono tangibili concetti astratti senza sacrificare la profondità. Il tono equilibrato riconosce i limiti ("alcuni problemi", "non facile") pur offrendo soluzioni praticabili ("dovrete intervistare la vostra IA"). Le citazioni di dati empirici (grafici di Epoch AI, il paper GDPval) conferiscono credibilità. Le analogie aziendali (assumere un VP, colloquio di lavoro) collegano l'adozione dell'IA a pratiche manageriali familiari. Tipico dello stile di Mollick (professore a Wharton e blogger accessibile) nel demistificare la complessità tecnica per un pubblico di professionisti.

## Pense-betes

- **Paradosso del benchmarking**: è "sorprendentemente difficile misurare esattamente quanto siano 'intelligenti'"
- **Problemi dei benchmark standard**:
- Chiavi di risposta pubbliche → incorporate nell'addestramento (accidentalmente o per gonfiare i punteggi)
- Ciò che i test misurano realmente è sconosciuto (MMLU-Pro: "capacità cranica media dell'Homo erectus?", "album live del 1979 dei Cheap Trick?")
- I test non sono calibrati: passare dall'84% all'85% è difficile quanto passare dal 40% al 41%?
- Punteggio massimo irraggiungibile (errori nelle domande, resoconti insoliti)
- **Valore collettivo**: tutti i benchmark mostrano una tendenza "verso l'alto e verso destra" (AIME, GPQA, MMLU, SWE-bench, LiveBench, Terminal-Bench, ARC-AGI, METR Long Tasks)
- **Fattore di capacità sottostante**: correlato all'impatto nel mondo reale, dalla medicina alla finanza
- **Lacuna dei benchmark**: focalizzati su matematica, scienze, ragionamento, codice — non su scrittura, analisi sociologica, consulenza aziendale, empatia
- **Citazione chiave**: "Ciò che vi interessa davvero è quale modello sarebbe migliore per LE VOSTRE esigenze" **Benchmark basato sui "vibes"**
- **Simon Willison**: test del pellicano in bicicletta
- **Test di Mollick**: lontra su un aereo, pannello di controllo di un'astronave in JavaScript, poesia difficile, videogiochi/shader, analisi di articoli, scrittura sui viaggi nel tempo
- **Domande poste**: Commette errori? Le risposte sono simili ad altri modelli? Temi/bias ricorrenti?
- **Esercizio di scrittura**: "Qualcuno sta razionando le parole rimanenti come scorte di guerra, e vi viene detto che ve ne restano 10.000 per tutta la vita. A 47 parole, state tenendo in braccio un neonato."
- **Pattern nei risultati**:
- Claude 4.5 Sonnet: solido modello di scrittura
- Gemini 2.5 Pro: non tiene il conto delle parole (attualmente il più debole)
- GPT-5 Thinking: stilista esuberante, metafore complesse, talvolta incoerente
- Kimi K2 Thinking: giri di frase interessanti, ma la storia è priva di senso
- **Limiti dei vibes**: idiosincratici, risposte diverse ogni volta, prompt migliori = risultati migliori, ci si affida a impressioni piuttosto che a misurazioni **Benchmark nel mondo reale: OpenAI GDPval**
- **Fase 1**: esperti (14 anni di esperienza in media: finanza, diritto, retail) creano progetti realistici e complessi che rappresentano da 4 a 7 ore di lavoro umano
- **Fase 2**: diversi modelli AI + esperti umani (pagati a ora) svolgono i compiti
- **Fase 3**: un terzo gruppo di esperti valuta i risultati alla cieca (sconosciuto se sia IA o umano), dedicando più di un'ora per domanda
- **Punti di forza**: i migliori modelli battono gli umani nello sviluppo software e nella consulenza finanziaria personale
- **Punti deboli**: farmacisti, ingegneri industriali e agenti immobiliari battono facilmente l'IA
- **Differenze tra modelli**: ChatGPT un migliore sales manager, Claude un migliore consulente finanziario
- **Rivela la forma della Jagged Frontier** e la sua evoluzione nel tempo **L'esperimento GuacaDrone**
- **Pitch**: un'idea dubbia — consegna di guacamole tramite drone
- **Metodo**: ogni modello AI valuta la fattibilità da 1 a 10, dieci volte ciascuno (le risposte variano ogni volta)
- **Risultati**:
- Grok: ottima idea (entusiasta)
- Microsoft Copilot: eccitato
- GPT-5 e Claude 4.5: più scettici
- Mollick personalmente: la valuterebbe 2 o meno
- **Implicazione**: "Valutare sistematicamente le idee 3-4 punti più in alto o più in basso significa orientarvi sistematicamente in una direzione diversa"
- **Impatto aziendale**: alcuni vogliono un'IA che accolga il rischio, altri una che lo eviti — capire come l'IA "pensa" le questioni critiche è essenziale **La prescrizione "intervistate il vostro modello"**
- **Individui**: i vibes bastano, fate il test della lontra (ormai diventato troppo facile — aggiornato a "filmato documentario anni '60 dell'ultimo famoso concerto prima dell'incidente del branco di lontre" in Sora 2)
- **Organizzazioni su larga scala**: una sfida diversa
- "Il migliore" non basta per migliaia di compiti e centinaia di dipendenti
- Bisogna sapere specificamente in cosa è bravo IL VOSTRO IA, non in media
- GDPval lo ha rivelato: le prestazioni dei modelli migliori variano significativamente a seconda del compito
- GuacaDrone: giudizio su domande ambigue, consigli sistematicamente diversi
- Le differenze si accumulano su larga scala
- **Da non fare affidamento**: né sui vibes né sui benchmark generali
- **Da fare**:
- Testare sistematicamente l'IA sul lavoro reale che svolgerà e sui giudizi reali che dovrà esprimere
- Creare scenari realistici che riflettano casi d'uso effettivi
- Eseguire più volte per individuare i pattern
- Far valutare i risultati da esperti
- Confrontare i modelli testa a testa sui compiti che contano
- "La differenza tra 'questo modello ha ottenuto l'85% su MMLU' e 'questo modello è più accurato nei nostri compiti di analisi finanziaria ma più prudente nella valutazione del rischio'"
- Più volte all'anno, man mano che escono nuovi modelli
- **Analogia finale**: "Non assumereste un VP basandovi solo sui suoi punteggi al SAT. Non dovreste scegliere un'IA che consiglierà migliaia di decisioni basandovi sul fatto che conosce la capacità cranica media dell'Homo erectus, poco meno di 1.000 centimetri cubici."

## RésuméDe400mots

Ethan Mollick sostiene che, nonostante i progressi misurabili nell'IA, i benchmark standard non riescono a cogliere ciò che conta davvero: le prestazioni sui VOSTRI compiti specifici con i VOSTRI criteri di giudizio. Prescrive di "intervistare" i modelli AI come candidati a un colloquio di lavoro piuttosto che affidarsi a punteggi di test generici.

**Problemi dei benchmark standard**

Benchmark come MMLU-Pro pongono domande oscure ("capacità cranica media dell'Homo erectus?", "titolo dell'album live del 1979 dei Cheap Trick?") il cui reale valore di misurazione è incerto. I test non sono calibrati (non si sa se passare dall'84% all'85% sia difficile quanto passare dal 40% al 41%), contengono errori e i punteggi massimi possono essere irraggiungibili. Peggio ancora: le chiavi di risposta pubbliche ne consentono l'incorporazione nell'addestramento (accidentalmente o deliberatamente). Nel complesso, tutti i benchmark (AIME, GPQA, MMLU, SWE-bench, ARC-AGI, METR) mostrano una tendenza "verso l'alto e verso destra", misurando un fattore di capacità sottostante correlato all'impatto nel mondo reale. Ma il loro focus su matematica, scienze, ragionamento e codice lascia lacune nella scrittura, nella consulenza aziendale e nell'empatia. "Ciò che vi interessa davvero è quale modello sarebbe migliore per LE VOSTRE esigenze."

**Benchmark basato sui "vibes": un approccio individuale**

I professionisti sviluppano test idiosincratici: Simon Willison chiede un pellicano in bicicletta, Mollick una lontra su un aereo, un pannello di controllo di un'astronave in JavaScript, poesie difficili, videogiochi. Un esercizio di scrittura rivela alcuni pattern: Claude 4.5 Sonnet è un solido scrittore, Gemini 2.5 Pro (attualmente il più debole) non tiene il conto del numero di parole, GPT-5 Thinking è uno stilista esuberante talvolta incoerente, Kimi K2 Thinking produce giri di frase interessanti ma una storia priva di senso. I vibes danno una "sensazione" sui modelli, ma restano idiosincratici: le risposte variano ogni volta e ci si affida a impressioni piuttosto che a misurazioni reali.

**Benchmark nel mondo reale: il metodo GDPval**

Il paper GDPval di OpenAI dimostra un approccio rigoroso: (1) esperti con 14 anni di esperienza in media creano progetti realistici e complessi che rappresentano da 4 a 7 ore di lavoro umano, (2) diversi modelli AI ed esperti umani svolgono i compiti, (3) un terzo gruppo di esperti valuta alla cieca, dedicando più di un'ora per domanda. Lo studio rivela i punti di forza dell'IA (sviluppo software, consulenza finanziaria: batte gli umani) e i suoi punti deboli (farmacisti, ingegneri industriali, agenti immobiliari battono l'IA). Emergono differenze tra i modelli: ChatGPT è un migliore sales manager, Claude un migliore consulente finanziario. La forma della "Jagged Frontier" prende forma.

**GuacaDrone rivela la personalità dei modelli**

Mollick propone un'idea dubbia, "consegna di guacamole tramite drone", e chiede ai modelli di valutarne la fattibilità da 1 a 10, dieci volte ciascuno. Grok è entusiasta, Copilot eccitato, GPT-5 e Claude scettici. Mollick stesso la valuterebbe 2 o meno. "Valutare sistematicamente le idee 3-4 punti più in alto o più in basso significa orientarvi sistematicamente in una direzione diversa." A seconda dell'azienda, si desidera un'IA che accolga o eviti il rischio: è necessario capire come l'IA "pensa" le questioni critiche.

**Prescrizione per le organizzazioni**

I vibes bastano per i singoli individui. Le organizzazioni che effettuano deployment su larga scala hanno bisogno di test sistematici: IA su lavoro reale e giudizi reali, scenari realistici, eseguiti più volte, valutati da esperti, con confronto diretto sui compiti che contano. "La differenza tra 'il modello ha ottenuto l'85% su MMLU' e 'il modello è più accurato nell'analisi finanziaria ma più prudente sul rischio'." Da rifare più volte all'anno man mano che escono nuovi modelli.

Analogia finale: "Non assumereste un VP basandovi solo sui suoi punteggi al SAT. Non scegliete l'IA che consiglierà migliaia di decisioni basandovi sulla sua conoscenza della capacità cranica media dell'Homo erectus."

## GrapheDeConnaissance

- Ethan Mollick —publie→ Giving your AI a Job Interview (DOCUMENT, 0.99)
- Ethan Mollick —recommande→ interviewer modèles IA sur tâches réelles (METHODOLOGIE, 0.98)
- Ethan Mollick —affirme_que→ les benchmarks standards échouent à mesurer la performance tâche-spécifique (AFFIRMATION, 0.95)
- questions de valeur incertaine —fait_partie_de→ MMLU-Pro (TECHNOLOGIE, 0.92)
- OpenAI —publie→ GDPval paper (DOCUMENT, 0.97)
- GDPval —mesure→ Jagged Frontier (CONCEPT, 0.95)
- Claude 4.5 Sonnet —surpasse→ autres modèles en écriture (TECHNOLOGIE, 0.88)
- Claude —surpasse→ ChatGPT en conseil financier (TECHNOLOGIE, 0.87)
- biais pro-risque dans évaluation idées —observé_dans→ Grok (TECHNOLOGIE, 0.9)
- Simon Willison —utilise→ test pelican sur vélo (METHODOLOGIE, 0.95)
- Ethan Mollick —utilise→ test loutre sur avion (METHODOLOGIE, 0.95)
- Ethan Mollick —affirme_que→ le vibes-based testing est insuffisant pour les organisations déployant l'IA à grande échelle (AFFIRMATION, 0.93)
- GDPval —mesure→ différences significatives de performance entre modèles par tâche (MESURE, 0.96)

---
Canonical: https://www.thekb.eu/it/fiches/mollick-giving-ai-job-interview-2025-11-12/
