- thekb.eu
- Wissensgraph
- Technologie
- Opus 4.7
Opus 4.7
Opus 4.7 — Technologie. Fähigkeit: Refactort 100k Zeilen, findet Zero-Days — aber jagged (uneinheitlich) bei einfachen Fragen · reasoning_effort_standard: xhigh (nach Korrektur) · score_expert_pass1: 48,6% (+-10,0%)
48.6% (+-10.0%) bei pass@1 auf Capture-the-Flag-Aufgaben für Experten: So platzierte das UK AI Safety Institute Opus 4.7 in seiner Evaluation vom 30 April 2026, hinter GPT-5.4 (52.4%) und weit hinter GPT-5.5 (71.4%). Dasselbe Modell refaktoriert 100k Zeilen Code und findet Zero-Days. Andrej Karpathy nutzt genau diese Lücke als sein Maß für Ungleichmäßigkeit: Opus 4.7 bewältigt das Refactoring und rät anschließend, die 50m zur Waschanlage zu Fuß zurückzulegen. Seine Erklärung dafür ist die Verifizierbarkeit, da die Labore Reinforcement Learning in Domänen einsetzen, in denen sich Antworten überprüfen lassen, was Spitzenwerte in Mathematik und Code erzeugt und Einbrüche anderswo.
Anthropics Post-Mortem vom April 2026 zeigt, dass das Verhalten eher durch Konfiguration als durch die Gewichte schwankt. Der standardmäßige Reasoning-Aufwand sank zwischen 4 March und 7 April von high auf medium, um Einfrieren der Oberfläche zu beheben; Nutzer empfanden Claude Code daraufhin als weniger intelligent, und Anthropic machte die Änderung rückgängig, indem es xhigh für Opus 4.7 und high für die übrigen Modelle festlegte. Eine separate Systemprompt-Anweisung, die die Ausführlichkeit begrenzte, kostete in Ablationstests 3% Intelligenz, bei Opus 4.6 ebenso wie bei Opus 4.7. Dasselbe Dokument schreibt dem Code-Review-Tool von Opus 4.7, das mit vollem Repository-Kontext arbeitet, die identification rétrospective du bug de cache zu, die Opus 4.6 nicht hatte liefern können.
Thariq Shihipar stützt sich auf eine andere Eigenschaft. HTML-Ausgabe kostet mehr Token als Markdown, und das 1MM-Kontextfenster von Opus 4.7 fängt diesen Unterschied auf. Die Generierung läuft dennoch zwei- bis viermal langsamer.
- Typ
- Technologie
- Fähigkeit
- Refactort 100k Zeilen, findet Zero-Days — aber jagged (uneinheitlich) bei einfachen Fragen
- reasoning_effort_standard
- xhigh (nach Korrektur)
- score_expert_pass1
- 48,6% (+-10,0%)
- Relationen
- 4
- Zitiert in
- 3 fiches