Zum Inhalt springen
Technologie

GPT-5.5

GPT-5.5 — Technologie. score_expert_pass1: 71,4% (+-8,0%) · score_expert_pass5: 90,5% (+-12,9%)

Das AI Safety Institute des Vereinigten Königreichs maß bei GPT-5.5 71,4% pass@1 (±8,0% Standardfehler) bei Capture-the-Flag-Aufgaben auf Expertenniveau sowie 90,5% pass@5 (±12,9%), den höchsten Wert, den AISI zum Zeitpunkt seiner vor dem Einsatz veröffentlichten Bewertung vom 30. April 2026 verzeichnet hatte. Wichtiger als der absolute Wert ist die Vergleichsgruppe: GPT-5.4 erzielte 52,4% und Opus 4.7 48,6%, während Mythos Preview bei 68,6% lag, statistisch gleichauf mit GPT-5.5. Einfache Aufgaben waren seit Februar 2026 bei jedem Frontier-Modell bei 100% gesättigt, sodass nur die schwierigeren Stufen überhaupt noch differenzieren.

Bei "The Last Ones (TLO)", einer mit SpecterOps aufgebauten 32-Schritte-Cyber-Range über vier Subnetze und rund zwanzig Maschinen, für die AISI schätzt, dass ein menschlicher Experte etwa 20 Stunden bräuchte, schloss GPT-5.5 die vollständige Angriffskette in 2 von 10 Versuchen ab, an zweiter Stelle hinter Mythos Preview mit 3/10. AISI-Red-Teamer fanden anschließend innerhalb von sechs Stunden einen universellen Jailbreak, der über die gesamte von OpenAI bereitgestellte Menge an böswilligen Cyberanfragen hinweg offensive Inhalte hervorrief. Ein Konfigurationsproblem verhinderte, dass AISI prüfen konnte, welche Schutzmaßnahmen tatsächlich ausgeliefert wurden.

Auf anderem Terrain liest sich dasselbe Modell anders. Dan Shipper nennt 62/100 beim Senior Engineer Benchmark gegenüber einer menschlichen Spanne von 80-90. Artificial Analysis platziert GPT-5.5 bei der Einstellung xhigh bei 1509 Elo auf GDPval-AA, gleichauf mit dem Open-Weights-Modell GLM-5.2 bei 1524 und deutlich hinter Claude Fable 5. Bis Juli 2026 war GPT-5.5 das auslaufende Flaggschiffmodell, dessen Preis von GPT-5.6 Sol übernommen wurde.

Typ
Technologie
score_expert_pass1
71,4% (+-8,0%)
score_expert_pass5
90,5% (+-12,9%)
Relationen
9
Zitiert in
1 fiches

Adoptionskennzahlen

Nachbarschaft

GPT-5.4 The Last Ones (TLO) Opus 4.7 jailbreak universel Mythos Preview GPT-5.6 GLM-5.2

→ übertrifft

GPT-5.4 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗
Opus 4.7 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

→ löst

The Last Ones (TLO) TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

← übertrifft

jailbreak universel CONCEPT hohe Konfidenz stabil Quelle ↗

→ konvergiert mit

Mythos Preview TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

← ersetzt

GPT-5.6 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

← konkurriert mit

GLM-5.2 TECHNOLOGIE hohe Konfidenz dynamisch Quelle ↗

Zitiert in (1)