- thekb.eu
- Graphe de connaissance
- Technologie
- Opus 4.7
Opus 4.7
Opus 4.7 — Technologie. capabilité : Refactor 100k lignes, find zero days — mais jagged sur questions simples · reasoning_effort_défaut : xhigh (après correction) · score_expert_pass1 : 48,6% (+-10,0%)
48.6 % (+-10,0 %) en pass@1 sur des tâches de capture-the-flag de niveau expert : c'est là que l'UK AI Safety Institute a placé Opus 4.7 dans son évaluation du 30 avril 2026, derrière GPT-5.4 (52,4 %) et loin derrière GPT-5.5 (71,4 %). Le même modèle refactore 100k lignes de code et ne trouve aucune faille zero-day. Andrej Karpathy se sert exactement de cet écart comme marqueur d'irrégularité : Opus 4.7 gère le refactoring, puis conseille de marcher 50m jusqu'au lave-auto. Son explication tient à la vérifiabilité : les laboratoires font tourner l'apprentissage par renforcement sur des domaines où les réponses sont vérifiables, ce qui crée des pics en maths et en code et des creux ailleurs.
Le post-mortem d'Anthropic sur avril 2026 montre un comportement qui oscille en fonction de la configuration plutôt que des poids. L'effort de raisonnement par défaut est passé de high à medium entre le 4 mars et le 7 avril pour corriger des gels d'interface ; les utilisateurs ont trouvé «Claude Code» moins intelligent, et Anthropic a fait marche arrière, en fixant xhigh pour «Opus 4.7» et high pour les autres. Une instruction distincte du system prompt plafonnant la verbosité a coûté 3 % d'intelligence lors des tests d'ablation, aussi bien pour «Opus 4.6» que pour «Opus 4.7». Le même document attribue à l'outil Code Review d'«Opus 4.7», chargé du contexte complet du dépôt, l'«identification rétrospective du bug de cache» qu'«Opus 4.6» n'avait pas réussi à produire.
Thariq Shihipar s'appuie sur une propriété différente. La sortie HTML coûte plus de tokens que le Markdown, et la fenêtre de contexte de 1MM d'«Opus 4.7» absorbe la différence. La génération reste deux à quatre fois plus lente.
- Type
- Technologie
- capabilité
- Refactor 100k lignes, find zero days — mais jagged sur questions simples
- reasoning_effort_défaut
- xhigh (après correction)
- score_expert_pass1
- 48,6% (+-10,0%)
- relations
- 4
- Citée dans
- 3 fiches