# ssrn-persona-prompting-ai-accuracy-2025-12-07

## Veille

Estudio de Wharton (Generative AI Labs): las personas expertas no mejoran la precisión factual de los LLM - benchmarks GPQA Diamond y MMLU-Pro - SSRN

## Titre Article

Playing Pretend: Expert Personas Don't Improve Factual Accuracy

## Date

2025-12-07

## URL

https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5879722

## Keywords

prompting de IA, personas, precisión de LLM, benchmarking de IA, GPQA Diamond, MMLU-Pro, rendimiento de IA, prompt engineering, personas expertas, evaluación de IA

## Authors

Savir Basil, Ina Shapiro, Dan Shapiro, Ethan Mollick, Lilach Mollick, Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)

## Ton

Perfil: artículo de investigación académica (working paper SSRN, Generative AI Labs de Wharton), registro científico y empírico, alto nivel técnico (estadística, benchmarks).
Estilo: enfoque experimental riguroso — protocolo detallado (25 respuestas independientes por pregunta y por par modelo-prompt), intervalos de confianza del 95%, resultados presentados por benchmark y por modelo. Tono mesurado y cauteloso, típico de los "resultados nulos": los autores refutan una práctica extendida sin sobregeneralizar y señalan sus limitaciones. Autoridad fundamentada en la afiliación a Wharton y la reputación de Ethan Mollick. Público objetivo: profesionales del prompt engineering, investigadores, equipos de IA empresarial.

## Pense-betes

- Pregunta probada: ¿asignar una persona experta a un LLM mejora su precisión en preguntas factuales difíciles? Respuesta: generalmente no
- 6 modelos probados: GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash
- 2 benchmarks: GPQA Diamond (198 preguntas de nivel doctoral) y MMLU-Pro (300 preguntas de nivel profesional)
- Protocolo: línea base (sin persona), personas expertas (física, matemáticas, economía, biología, química, ingeniería, derecho, historia), personas de "bajo conocimiento" (Layperson, Young Child, Toddler); 25 respuestas independientes por pregunta y por par modelo-prompt
- Resultado principal: la mayoría de las condiciones de persona son estadísticamente indistinguibles de la línea base
- Las personas de bajo conocimiento a menudo degradan la precisión; la persona "Toddler" es perjudicial en 4/6 modelos
- Excepción: Gemini 2.0 Flash muestra mejoras modestas con las 5 personas expertas en MMLU-Pro (notablemente en ingeniería y química)
- Alinear la persona experta con el dominio de la pregunta no aporta una mejora consistente
- Modo de fallo observado: los modelos Gemini Flash a veces se niegan a responder con una persona experta fuera de dominio; la sobreespecialización lleva a infrautilizar el conocimiento real
- Implicación práctica: privilegiar instrucciones específicas para la tarea frente a las personas; las personas siguen siendo útiles para el tono/estilo, no para la precisión
- Limitaciones: subconjunto de modelos, benchmarks académicos, número limitado de personas, sin interacción probada con otras técnicas de prompting

## RésuméDe400mots

Este estudio del Generative AI Labs de Wharton examina si asignar personas expertas a modelos de IA mejora su rendimiento en preguntas objetivas de opción múltiple de alta dificultad. Los investigadores probaron seis modelos (GPT-4o, GPT-4o-mini, o3-mini, o4-mini, Gemini 2.0 Flash, Gemini 2.5 Flash) en dos benchmarks exigentes: GPQA Diamond (198 preguntas de nivel doctoral) y MMLU-Pro (300 preguntas de nivel profesional).

El protocolo compara tres condiciones: una línea base sin persona, personas expertas (experto en física, matemáticas, economía, biología, química, ingeniería, derecho, historia) y personas de "bajo conocimiento" (Layperson, Young Child, Toddler — "un niño de 4 años que cree que la luna está hecha de queso"). Cada par modelo-prompt se evalúa mediante 25 respuestas independientes por pregunta (4.950 ejecuciones por par en GPQA, 7.500 en MMLU-Pro), con intervalos de confianza del 95%.

Los resultados son esencialmente nulos: la mayoría de las condiciones de persona producen un rendimiento estadísticamente indistinguible de la línea base. En GPQA Diamond, ninguna persona experta o de bajo conocimiento mejora de forma fiable el rendimiento; la única excepción es una pequeña ganancia con el prompt "Young Child" en Gemini 2.5 Flash (RD = 0,098). En MMLU-Pro, ninguna persona experta produce una mejora estadísticamente significativa en 5 de los 6 modelos, y se observan nueve diferencias negativas significativas. Las personas de bajo conocimiento a menudo degradan la precisión: la persona "Toddler" reduce el rendimiento en 4 de 6 modelos y resulta significativamente peor que "Layperson" en 5 de 6 modelos.

La excepción notable es Gemini 2.0 Flash, que muestra diferencias positivas modestas con las cinco personas expertas en MMLU-Pro, en particular en ingeniería y química. Además, alinear la persona experta con el dominio de la pregunta no aporta ningún beneficio consistente. Los investigadores identifican modos de fallo: los modelos Gemini Flash a veces se niegan a responder cuando se les asigna una persona experta fuera de dominio, y las instrucciones de rol demasiado restrictivas llevan a los modelos a infrautilizar su conocimiento real.

Las implicaciones prácticas son importantes: la práctica generalizada del prompting con personas es probablemente ineficaz para mejorar la precisión factual. Las organizaciones obtendrán más valor de instrucciones específicas para la tarea, y deberían probar varias variantes de prompt para sus problemas concretos. Las personas pueden, no obstante, conservar otros usos, como modular el tono o el estilo de presentación. Las limitaciones del estudio (un número limitado de modelos y personas, benchmarks académicos) abren vías para futuras investigaciones.

## GrapheDeConnaissance

- Generative AI Labs —publie→ étude personas et précision IA (DOCUMENT, 0.98)
- Ethan Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- Lilach Mollick —publie→ étude personas et précision IA (DOCUMENT, 0.95)
- étude personas et précision IA —affirme_que→ les personas experts n'améliorent pas la précision factuelle des LLM (AFFIRMATION, 0.95)
- personas faible connaissance —réduit→ performance des LLM (CONCEPT, 0.92)
- Gemini 2.0 Flash —mesure→ amélioration modeste avec personas experts (MMLU-Pro) (MESURE, 0.85)
- persona Toddler —réduit→ performance dans 4/6 modèles (CONCEPT, 0.9)
- étude personas et précision IA —utilise→ GPQA Diamond (TECHNOLOGIE, 0.95)
- étude personas et précision IA —utilise→ MMLU-Pro (TECHNOLOGIE, 0.95)
- étude personas et précision IA —affirme_que→ la correspondance domaine-persona n'améliore pas la performance de manière consistante (AFFIRMATION, 0.88)
- refus de répondre avec personas hors domaine —observé_dans→ modèles Gemini Flash (TECHNOLOGIE, 0.82)

---
Canonical: https://www.thekb.eu/es/fiches/ssrn-persona-prompting-ai-accuracy-2025-12-07/
