Saltar al contenido
Tecnología

GPT-5.5

GPT-5.5 — Tecnología. score_expert_pass1: 71,4% (+-8,0%) · score_expert_pass5: 90,5% (+-12,9%)

El AI Safety Institute del Reino Unido midió a GPT-5.5 en un 71,4% de pass@1 (±8,0% de error estándar) en tareas de captura de bandera de nivel experto, y un 90,5% de pass@5 (±12,9%), la puntuación más alta que AISI había registrado hasta el momento de su evaluación previa al despliegue, publicada el 30 de abril de 2026. El conjunto de comparación importa más que la cifra absoluta: GPT-5.4 obtuvo un 52,4% y Opus 4.7 un 48,6%, mientras que Mythos Preview se situó en 68,6%, estadísticamente al mismo nivel que GPT-5.5. Las tareas básicas habían quedado saturadas al 100% en todos los modelos de frontera desde febrero de 2026, de modo que solo los niveles más difíciles siguen distinguiendo algo.

En "The Last Ones (TLO)", un campo de pruebas cibernético de 32 pasos construido con SpecterOps a lo largo de cuatro subredes y unas veinte máquinas, que AISI estima que a un experto humano le llevaría unas 20 horas, GPT-5.5 completó la cadena de ataque completa en 2 intentos de 10, por detrás de Mythos Preview con 3/10. Los red-teamers de AISI encontraron después un jailbreak universal en seis horas, provocando contenido ofensivo en todo el conjunto de solicitudes cibernéticas maliciosas que proporcionó OpenAI. Un problema de configuración impidió a AISI verificar las salvaguardas que finalmente se enviaron.

El mismo modelo se lee de otra manera en otros terrenos. Dan Shipper cita un 62/100 en el benchmark Senior Engineer, frente a un rango humano de 80-90. Artificial Analysis sitúa a GPT-5.5, en su configuración xhigh, en 1509 Elo en GDPval-AA, empatado con el modelo de pesos abiertos GLM-5.2 en 1524 y muy por detrás de Claude Fable 5. Para julio de 2026, GPT-5.5 era ya el buque insignia saliente, con su precio heredado por GPT-5.6 Sol.

Tipo
Tecnología
score_expert_pass1
71,4% (+-8,0%)
score_expert_pass5
90,5% (+-12,9%)
relaciones
9
Citada en
1 fiches

Métricas de adopción

Vecindario

GPT-5.4 The Last Ones (TLO) Opus 4.7 jailbreak universel Mythos Preview GPT-5.6 GLM-5.2

→ supera

GPT-5.4 TECHNOLOGIE confianza alta estable Fuente ↗
Opus 4.7 TECHNOLOGIE confianza alta estable Fuente ↗

→ resuelve

The Last Ones (TLO) TECHNOLOGIE confianza alta estable Fuente ↗

← supera

jailbreak universel CONCEPT confianza alta estable Fuente ↗

→ converge con

Mythos Preview TECHNOLOGIE confianza alta estable Fuente ↗

← reemplaza

GPT-5.6 TECHNOLOGIE confianza alta estable Fuente ↗

← compite con

GLM-5.2 TECHNOLOGIE confianza alta dinámico Fuente ↗

Citada en (1)