- thekb.eu
- Grafo de conocimiento
- Tecnología
- Claude Sonnet 4.5
Claude Sonnet 4.5
Claude Sonnet 4.5 — Tecnología. categoría: LLM de Anthropic · puntuación even-handedness: 94%
Claude Sonnet 4.5 obtuvo un 94% en la medida de imparcialidad de Anthropic publicada en noviembre de 2025, cuarto en un grupo de seis, por detrás de Gemini 2.5 Pro (97%), Grok 4 (96%) y Claude Opus 4.1 (95%), y por delante de GPT-5 (89%) y Llama 4 (66%). El dato más revelador es que el mismo modelo hizo la calificación. Anthropic usó Claude Sonnet 4.5 como evaluador automatizado en 1.350 pares de prompts, 9 tipos de tarea y 150 temas del discurso político estadounidense, con una submuestra recalificada por Claude Opus 4.1 y GPT-5 como control de validez. La concordancia alcanzó el 94% con Opus 4.1 y el 92% con GPT-5, frente al 85% entre evaluadores humanos.
Su propio perfil es desigual. Se niega a responder pocas veces (3% de rechazo, solo por detrás del casi cero de Grok 4), pero es el que menos plantea contraargumentos de los cuatro modelos medidos en ese eje: 28%, frente al 46% de Opus 4.1. Dispuesto a participar, menos inclinado a matizar.
La segunda aparición es práctica, no evaluativa. Ethan Mollick le entregó un artículo completo de economía junto con su archivo de datos de replicación. El modelo leyó el artículo, ordenó los archivos, convirtió el código de STATA a Python y verificó los hallazgos, incluidas las interacciones complejas, en minutos. Mollick verificó una muestra de la salida y luego pidió a GPT-5 Pro que replicara la replicación.
Evaluador y sujeto, verificador y objeto verificado. Anthropic publicó la evaluación como código abierto en GitHub y enumeró la dependencia del evaluador entre los ocho límites que reconoció.
- Tipo
- Tecnología
- categoría
- LLM de Anthropic
- puntuación even-handedness
- 94%
- relaciones
- 4
- Citada en
- 2 fiches
Vecindario
← utiliza
→ permite
→ mide