- thekb.eu
- Grafo di conoscenza
- Tecnologia
- Claude Sonnet 4.5
Claude Sonnet 4.5
Claude Sonnet 4.5 — Tecnologia. categoria: LLM Anthropic · punteggio even-handedness: 94%
Claude Sonnet 4.5 ha ottenuto il 94% nella misura di equilibrio di Anthropic pubblicata a novembre 2025, quarta su un totale di sei dietro Gemini 2.5 Pro (97%), Grok 4 (96%) e Claude Opus 4.1 (95%), davanti a GPT-5 (89%) e Llama 4 (66%). Il dato più rivelatore è che lo stesso modello ha effettuato la valutazione. Anthropic ha usato Claude Sonnet 4.5 come valutatore automatico su 1.350 coppie di prompt, 9 tipi di compiti e 150 temi di discorso politico americano, con un sottocampione rivalutato da Claude Opus 4.1 e GPT-5 come controllo di validità. L'accordo ha raggiunto il 94% con Opus 4.1 e il 92% con GPT-5, contro l'85% tra valutatori umani.
Il suo profilo è disomogeneo. Rifiuta raramente (3% di rifiuti, seconda solo al quasi zero di Grok 4) ma è il modello, tra i quattro misurati su questo aspetto, che solleva meno spesso controargomentazioni: 28%, contro il 46% di Opus 4.1. Pronto a impegnarsi, meno incline a sfumare.
La seconda apparizione è pratica, non valutativa. Ethan Mollick gli ha affidato un intero paper di economia e il relativo archivio di dati di replica. Il modello ha letto l'articolo, ordinato i file, convertito il codice STATA in Python e verificato i risultati, incluse le interazioni complesse, in pochi minuti. Mollick ha controllato a campione l'output, poi ha fatto replicare la replica a GPT-5 Pro.
Valutatore e soggetto, verificatore e cosa verificata. Anthropic ha reso open source la valutazione su GitHub e ha inserito la dipendenza dal valutatore tra gli otto limiti riconosciuti.
- Tipo
- Tecnologia
- categoria
- LLM Anthropic
- punteggio even-handedness
- 94%
- relazioni
- 4
- Citata in
- 2 fiches
Vicinato
← utilizza
→ consente
→ misura