Vai al contenuto
Tecnologia

Opus 4.7

Opus 4.7 — Tecnologia. capacità: Refactor 100k righe, find zero days — ma jagged su domande semplici · reasoning_effort_predefinito: xhigh (dopo la correzione) · score_expert_pass1: 48,6% (+-10,0%)

48.6% (+-10.0%) di pass@1 su compiti capture-the-flag di livello esperto: è qui che lo UK AI Safety Institute ha collocato Opus 4.7 nella sua valutazione del 30 aprile 2026, dietro a GPT-5.4 (52.4%) e ben dietro a GPT-5.5 (71.4%). Lo stesso modello rifattorizza 100k righe di codice e non trova zero day. Andrej Karpathy usa esattamente questo scarto come indicatore di frastagliatura: Opus 4.7 gestisce il refactoring, poi consiglia di percorrere 50m a piedi fino all'autolavaggio. La sua spiegazione del perché riguarda la verificabilità, dato che i laboratori eseguono reinforcement learning su domini in cui le risposte possono essere verificate, il che genera picchi in matematica e codice e cali altrove.

Il post-mortem di Anthropic sull'aprile 2026 mostra un comportamento che oscilla in base alla configurazione più che ai pesi. Lo sforzo di ragionamento predefinito è sceso da high a medium tra il 4 marzo e il 7 aprile per risolvere blocchi dell'interfaccia; gli utenti hanno segnalato che Claude Code sembrava meno intelligente, e Anthropic ha fatto marcia indietro, impostando xhigh per Opus 4.7 e high per gli altri. Un'istruzione separata nel system prompt che limitava la verbosità è costata il 3% di intelligenza nei test di ablazione, sia per Opus 4.6 sia per Opus 4.7. Lo stesso documento attribuisce allo strumento Code Review di Opus 4.7, caricato con il contesto completo del repository, l'identification rétrospective du bug de cache che Opus 4.6 non era riuscito a produrre.

Thariq Shihipar si basa su una proprietà diversa. L'output HTML costa più token rispetto a Markdown, e la finestra di contesto da 1MM di Opus 4.7 assorbe la differenza. La generazione resta comunque due-quattro volte più lenta.

Tipo
Tecnologia
capacità
Refactor 100k righe, find zero days — ma jagged su domande semplici
reasoning_effort_predefinito
xhigh (dopo la correzione)
score_expert_pass1
48,6% (+-10,0%)
relazioni
4
Citata in
3 fiches

Vicinato

1MM context window GPT-5.5 identification rétro… Opus 4.6

→ utilizza

1MM context window CONCEPT affidabilità alta stabile Fonte ↗

← supera

GPT-5.5 TECHNOLOGIE affidabilità alta stabile Fonte ↗

→ risolve

identification rétrospective du bug de cache EVENEMENT affidabilità alta stabile Fonte ↗

→ supera

Opus 4.6 TECHNOLOGIE affidabilità alta stabile Fonte ↗

Citata in (3)