GPT-5.5
GPT-5.5 — Technologie. score_expert_pass1 : 71,4% (+-8,0%) · score_expert_pass5 : 90,5% (+-12,9%)
L'AI Safety Institute du Royaume-Uni a mesuré GPT-5.5 à 71.4% de pass@1 (±8.0% d'erreur type) sur des tâches de capture-the-flag de niveau expert, et 90.5% de pass@5 (±12.9%), le score le plus élevé enregistré par l'AISI au moment de son évaluation pré-déploiement publiée le 30 avril 2026. L'ensemble de comparaison compte plus que le chiffre absolu : GPT-5.4 a obtenu 52.4% et Opus 4.7 48.6%, tandis que Mythos Preview se situait à 68.6%, statistiquement à égalité avec GPT-5.5. Les tâches de base étaient saturées à 100% par tous les modèles de pointe depuis février 2026, si bien que seuls les niveaux les plus difficiles permettent encore de les distinguer.
Sur « The Last Ones (TLO) », un champ de tir cyber en 32 étapes construit avec SpecterOps sur quatre sous-réseaux et une vingtaine de machines, qu'AISI estime nécessiter environ 20 heures pour un expert humain, GPT-5.5 a mené la chaîne d'attaque complète à son terme en 2 tentatives sur 10, derrière Mythos Preview à 3/10. Les red-teamers de l'AISI ont ensuite trouvé un jailbreak universel en six heures, obtenant du contenu offensif sur l'ensemble des requêtes cyber malveillantes fournies par OpenAI. Un problème de configuration a empêché l'AISI de vérifier les garde-fous effectivement livrés.
Le même modèle se lit différemment sur un autre terrain. Dan Shipper cite un score de 62/100 sur le benchmark Senior Engineer, contre une fourchette humaine de 80-90. Artificial Analysis situe GPT-5.5 en configuration xhigh à 1509 Elo sur GDPval-AA, à égalité avec le modèle à poids ouverts GLM-5.2 à 1524 et bien derrière Claude Fable 5. En juillet 2026, GPT-5.5 était le modèle phare sortant, son prix repris par GPT-5.6 Sol.
- Type
- Technologie
- score_expert_pass1
- 71,4% (+-8,0%)
- score_expert_pass5
- 90,5% (+-12,9%)
- relations
- 9
- Citée dans
- 1 fiches