# ssrn-persona-prompting-ai-accuracy-2025-12-07

## Veille

Wharton-Studie (Generative AI Labs): Expertenpersonas verbessern die faktische Genauigkeit von LLMs nicht - GPQA Diamond- und MMLU-Pro-Benchmarks - SSRN

## Titre Article

Playing Pretend: Expert Personas Don't Improve Factual Accuracy

## Date

2025-12-07

## URL

https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5879722

## Keywords

KI-Prompting, Personas, LLM-Genauigkeit, KI-Benchmarking, GPQA Diamond, MMLU-Pro, KI-Leistung, Prompt Engineering, Expertenpersonas, KI-Evaluation

## Authors

Savir Basil, Ina Shapiro, Dan Shapiro, Ethan Mollick, Lilach Mollick, Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)

## Ton

Profil: akademisches Forschungspapier (SSRN Working Paper, Generative AI Labs der Wharton School), wissenschaftliches und empirisches Register, hohes technisches Niveau (Statistik, Benchmarks).
Stil: rigoroser experimenteller Ansatz — detailliertes Protokoll (25 unabhängige Antworten pro Frage und pro Modell-Prompt-Paar), 95%-Konfidenzintervalle, Ergebnisse aufgeschlüsselt nach Benchmark und Modell. Gemessener und vorsichtiger Ton, typisch für "Nullergebnisse": Die Autoren widerlegen eine weit verbreitete Praxis, ohne zu übergeneralisieren, und weisen auf ihre Grenzen hin. Autorität gestützt auf die Wharton-Zugehörigkeit und den Ruf von Ethan Mollick. Zielgruppe: Prompt-Engineering-Praktiker, Forscher, Enterprise-KI-Teams.

## Pense-betes

- Getestete Frage: Verbessert die Zuweisung einer Expertenpersona an ein LLM dessen Genauigkeit bei schwierigen faktischen Fragen? Antwort: im Allgemeinen nein
- 6 getestete Modelle: GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash
- 2 Benchmarks: GPQA Diamond (198 Fragen auf Doktorandenniveau) und MMLU-Pro (300 Fragen auf professionellem Niveau)
- Protokoll: Baseline (keine Persona), Expertenpersonas (Physik, Mathematik, Wirtschaft, Biologie, Chemie, Ingenieurwesen, Recht, Geschichte), Personas mit "geringem Wissen" (Laie, kleines Kind, Kleinkind); 25 unabhängige Antworten pro Frage und pro Modell-Prompt-Paar
- Hauptergebnis: Die meisten Persona-Bedingungen sind statistisch nicht von der Baseline zu unterscheiden
- Personas mit geringem Wissen verschlechtern häufig die Genauigkeit; die Persona "Kleinkind" ist bei 4/6 Modellen schädlich
- Ausnahme: Gemini 2.0 Flash zeigt bei MMLU-Pro mit allen 5 Expertenpersonas moderate Verbesserungen (insbesondere Ingenieurwesen und Chemie)
- Die Abstimmung der Expertenpersona auf den Themenbereich der Frage bringt keine konsistente Verbesserung
- Beobachteter Fehlermodus: Gemini-Flash-Modelle verweigern manchmal die Antwort bei einer fachfremden Expertenpersona; Überspezialisierung führt zu unzureichender Nutzung des tatsächlichen Wissens
- Praktische Implikation: aufgabenspezifische Anweisungen gegenüber Personas bevorzugen; Personas bleiben nützlich für Ton/Stil, nicht für Genauigkeit
- Grenzen: Teilmenge an Modellen, akademische Benchmarks, begrenzte Anzahl an Personas, keine getestete Interaktion mit anderen Prompting-Techniken

## RésuméDe400mots

Diese Studie des Generative AI Labs der Wharton School untersucht, ob die Zuweisung von Expertenpersonas an KI-Modelle deren Leistung bei schwierigen objektiven Multiple-Choice-Fragen verbessert. Die Forscher testeten sechs Modelle (GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash) anhand zweier anspruchsvoller Benchmarks: GPQA Diamond (198 Fragen auf Doktorandenniveau) und MMLU-Pro (300 Fragen auf professionellem Niveau).

Das Protokoll vergleicht drei Bedingungen: eine Baseline ohne Persona, Expertenpersonas (Experte in Physik, Mathematik, Wirtschaft, Biologie, Chemie, Ingenieurwesen, Recht, Geschichte) und Personas mit "geringem Wissen" (Laie, kleines Kind, Kleinkind — "ein 4-jähriges Kind, das glaubt, der Mond bestehe aus Käse"). Jedes Modell-Prompt-Paar wird über 25 unabhängige Antworten pro Frage bewertet (4.950 Durchläufe pro Paar bei GPQA, 7.500 bei MMLU-Pro), mit 95%-Konfidenzintervallen.

Die Ergebnisse sind im Wesentlichen null: Die meisten Persona-Bedingungen erzeugen eine Leistung, die statistisch nicht von der Baseline zu unterscheiden ist. Bei GPQA Diamond verbessert keine Experten- oder Niedrigwissen-Persona die Leistung zuverlässig; die einzige Ausnahme ist ein kleiner Gewinn durch den Prompt "kleines Kind" bei Gemini 2.5 Flash (RD = 0,098). Bei MMLU-Pro liefert keine Expertenpersona eine statistisch signifikante Verbesserung für 5 der 6 Modelle, und es werden neun signifikante negative Unterschiede beobachtet. Personas mit geringem Wissen verschlechtern häufig die Genauigkeit: Die Persona "Kleinkind" reduziert die Leistung bei 4 von 6 Modellen und erweist sich bei 5 von 6 Modellen als signifikant schlechter als "Laie".

Die bemerkenswerte Ausnahme ist Gemini 2.0 Flash, das bei MMLU-Pro mit allen fünf Expertenpersonas moderate positive Unterschiede zeigt, insbesondere in Ingenieurwesen und Chemie. Zudem bietet die Abstimmung der Expertenpersona auf den Themenbereich der Frage keinen konsistenten Nutzen. Die Forscher identifizieren Fehlermodi: Die Gemini-Flash-Modelle verweigern manchmal die Antwort, wenn ihnen eine fachfremde Expertenpersona zugewiesen wird, und zu eng gefasste Rolleninstruktionen führen dazu, dass die Modelle ihr tatsächliches Wissen unzureichend nutzen.

Die praktischen Implikationen sind erheblich: Die weit verbreitete Praxis des Persona-Promptings ist zur Verbesserung der faktischen Genauigkeit wahrscheinlich wirkungslos. Organisationen ziehen mehr Nutzen aus aufgabenspezifischen Anweisungen und sollten mehrere Prompt-Varianten für ihre konkreten Probleme testen. Personas können dennoch andere Verwendungszwecke behalten, etwa die Modulation von Ton oder Präsentationsstil. Die Grenzen der Studie (begrenzte Anzahl an Modellen und Personas, akademische Benchmarks) eröffnen Ansatzpunkte für zukünftige Forschung.

## GrapheDeConnaissance

- Generative AI Labs —publie→ étude personas et précision IA (DOCUMENT, 0.98)
- Ethan Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- Lilach Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- étude personas et précision IA —affirme_que→ les personas experts n'améliorent pas la précision factuelle des LLM (AFFIRMATION, 0.95)
- personas faible connaissance —réduit→ performance des LLM (CONCEPT, 0.92)
- Gemini 2.0 Flash —mesure→ amélioration modeste avec personas experts (MMLU-Pro) (MESURE, 0.85)
- persona Toddler —réduit→ performance dans 4/6 modèles (CONCEPT, 0.9)
- étude personas et précision IA —utilise→ GPQA Diamond (TECHNOLOGIE, 0.95)
- étude personas et précision IA —utilise→ MMLU-Pro (TECHNOLOGIE, 0.95)
- étude personas et précision IA —affirme_que→ la correspondance domaine-persona n'améliore pas la performance de manière consistante (AFFIRMATION, 0.88)
- refus de répondre avec personas hors domaine —observé_dans→ modèles Gemini Flash (TECHNOLOGIE, 0.82)

---
Canonical: https://www.thekb.eu/de/fiches/ssrn-persona-prompting-ai-accuracy-2025-12-07/
