# ssrn-persona-prompting-ai-accuracy-2025-12-07

## Veille

Studio Wharton (Generative AI Labs): i personas esperti non migliorano l'accuratezza fattuale degli LLM - benchmark GPQA Diamond e MMLU-Pro - SSRN

## Titre Article

Playing Pretend: Expert Personas Don't Improve Factual Accuracy

## Date

2025-12-07

## URL

https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5879722

## Keywords

prompting IA, personas, accuratezza LLM, benchmarking IA, GPQA Diamond, MMLU-Pro, prestazioni IA, prompt engineering, personas esperti, valutazione IA

## Authors

Savir Basil, Ina Shapiro, Dan Shapiro, Ethan Mollick, Lilach Mollick, Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)

## Ton

Profilo: articolo di ricerca accademica (working paper SSRN, Generative AI Labs di Wharton), registro scientifico ed empirico, alto livello tecnico (statistiche, benchmark).
Stile: approccio sperimentale rigoroso — protocollo dettagliato (25 risposte indipendenti per domanda e per coppia modello-prompt), intervalli di confidenza al 95%, risultati riportati per benchmark e per modello. Tono misurato e prudente, tipico dei "risultati nulli": gli autori confutano una pratica diffusa senza generalizzare eccessivamente e segnalano i propri limiti. Autorevolezza fondata sull'affiliazione a Wharton e sulla reputazione di Ethan Mollick. Pubblico di riferimento: professionisti del prompt engineering, ricercatori, team di IA aziendali.

## Pense-betes

- Domanda testata: assegnare una persona esperta a un LLM ne migliora l'accuratezza su domande fattuali difficili? Risposta: in generale no
- 6 modelli testati: GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash
- 2 benchmark: GPQA Diamond (198 domande di livello dottorale) e MMLU-Pro (300 domande di livello professionale)
- Protocollo: baseline (nessuna persona), personas esperti (fisica, matematica, economia, biologia, chimica, ingegneria, diritto, storia), personas a "basso livello di conoscenza" (Layperson, Young Child, Toddler); 25 risposte indipendenti per domanda e per coppia modello-prompt
- Risultato principale: la maggior parte delle condizioni con persona è statisticamente indistinguibile dalla baseline
- Le personas a basso livello di conoscenza spesso degradano l'accuratezza; la persona "Toddler" è dannosa in 4/6 modelli
- Eccezione: Gemini 2.0 Flash mostra modesti miglioramenti con tutte le 5 personas esperte su MMLU-Pro (in particolare Ingegneria e Chimica)
- Allineare la persona esperta al dominio della domanda non offre un miglioramento costante
- Modalità di fallimento osservata: i modelli Gemini Flash a volte rifiutano di rispondere con una persona esperta fuori dominio; l'eccessiva specializzazione porta a un sotto-utilizzo della conoscenza reale
- Implicazione pratica: privilegiare istruzioni specifiche al compito rispetto alle personas; le personas restano utili per tono/stile, non per l'accuratezza
- Limiti: sottoinsieme di modelli, benchmark accademici, numero limitato di personas, nessuna interazione testata con altre tecniche di prompting

## RésuméDe400mots

Questo studio del Generative AI Labs di Wharton esamina se l'assegnazione di personas esperti ai modelli di IA migliori le loro prestazioni su domande difficili a risposta multipla oggettiva. I ricercatori hanno testato sei modelli (GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash) su due benchmark impegnativi: GPQA Diamond (198 domande di livello dottorale) e MMLU-Pro (300 domande di livello professionale).

Il protocollo confronta tre condizioni: una baseline senza persona, personas esperti (esperto in fisica, matematica, economia, biologia, chimica, ingegneria, diritto, storia) e personas a "basso livello di conoscenza" (Layperson, Young Child, Toddler — "un bambino di 4 anni convinto che la luna sia fatta di formaggio"). Ogni coppia modello-prompt viene valutata su 25 risposte indipendenti per domanda (4.950 esecuzioni per coppia su GPQA, 7.500 su MMLU-Pro), con intervalli di confidenza al 95%.

I risultati sono sostanzialmente nulli: la maggior parte delle condizioni con persona produce prestazioni statisticamente indistinguibili dalla baseline. Su GPQA Diamond, nessuna persona esperta o a basso livello di conoscenza migliora in modo affidabile le prestazioni; l'unica eccezione è un piccolo guadagno del prompt "Young Child" su Gemini 2.5 Flash (RD = 0,098). Su MMLU-Pro, nessuna persona esperta produce un miglioramento statisticamente significativo per 5 dei 6 modelli, e si osservano nove differenze negative significative. Le personas a basso livello di conoscenza spesso degradano l'accuratezza: la persona "Toddler" riduce le prestazioni in 4 dei 6 modelli e risulta significativamente peggiore di "Layperson" in 5 dei 6 modelli.

L'eccezione degna di nota è Gemini 2.0 Flash, che mostra modeste differenze positive con tutte e cinque le personas esperte su MMLU-Pro, in particolare in ingegneria e chimica. Inoltre, allineare la persona esperta al dominio della domanda non offre alcun beneficio costante. I ricercatori individuano modalità di fallimento: i modelli Gemini Flash a volte rifiutano di rispondere quando viene assegnata loro una persona esperta fuori dominio, e istruzioni di ruolo troppo ristrette portano i modelli a sotto-utilizzare la loro conoscenza reale.

Le implicazioni pratiche sono significative: la pratica diffusa del persona prompting è probabilmente inefficace per migliorare l'accuratezza fattuale. Le organizzazioni trarranno maggiore valore da istruzioni specifiche al compito, e dovrebbero testare più varianti di prompt per i loro problemi concreti. Le personas possono comunque conservare altri usi, come la modulazione del tono o dello stile di presentazione. I limiti dello studio (un numero limitato di modelli e personas, benchmark accademici) aprono piste per ricerche future.

## GrapheDeConnaissance

- Generative AI Labs —publie→ étude personas et précision IA (DOCUMENT, 0.98)
- Ethan Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- Lilach Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- étude personas et précision IA —affirme_que→ les personas experts n'améliorent pas la précision factuelle des LLM (AFFIRMATION, 0.95)
- personas faible connaissance —réduit→ performance des LLM (CONCEPT, 0.92)
- Gemini 2.0 Flash —mesure→ amélioration modeste avec personas experts (MMLU-Pro) (MESURE, 0.85)
- persona Toddler —réduit→ performance dans 4/6 modèles (CONCEPT, 0.9)
- étude personas et précision IA —utilise→ GPQA Diamond (TECHNOLOGIE, 0.95)
- étude personas et précision IA —utilise→ MMLU-Pro (TECHNOLOGIE, 0.95)
- étude personas et précision IA —affirme_que→ la correspondance domaine-persona n'améliore pas la performance de manière consistante (AFFIRMATION, 0.88)
- refus de répondre avec personas hors domaine —observé_dans→ modèles Gemini Flash (TECHNOLOGIE, 0.82)

---
Canonical: https://www.thekb.eu/it/fiches/ssrn-persona-prompting-ai-accuracy-2025-12-07/
