Saltar al contenido
Tecnología

Opus 4.7

Opus 4.7 — Tecnología. capacidad: Refactor 100k líneas, encuentra zero days — pero irregular en preguntas simples · reasoning_effort_predeterminado: xhigh (tras corrección) · score_expert_pass1: 48,6% (+-10,0%)

48.6% (±10,0%) en pass@1 en tareas expertas de captura la bandera: ahí fue donde el UK AI Safety Institute situó a Opus 4.7 en su evaluación del 30 de abril de 2026, por detrás de GPT-5.4 (52,4%) y bastante por detrás de GPT-5.5 (71,4%). El mismo modelo refactoriza 100k líneas de código y no encuentra ningún día cero. Andrej Karpathy usa exactamente esa brecha como su marcador de irregularidad: Opus 4.7 se ocupa de la refactorización y luego aconseja caminar 50m hasta el túnel de lavado. Su explicación de por qué apunta a la verificabilidad, ya que los laboratorios entrenan con aprendizaje por refuerzo en dominios donde las respuestas se pueden comprobar, lo que genera picos en matemáticas y código y valles en el resto.

El post-mortem de Anthropic de abril de 2026 muestra un comportamiento que oscila según la configuración, no según los pesos. El esfuerzo de razonamiento por defecto bajó de alto a medio entre el 3 de marzo y el 7 de abril para corregir los bloqueos de la interfaz; los usuarios dijeron que «Claude Code» se sentía menos inteligente, y Anthropic dio marcha atrás, fijando xhigh para Opus 4.7 y high para los demás. Una instrucción separada del system prompt que limitaba la verbosidad costó un 3% de inteligencia en pruebas de ablación, tanto para Opus 4.6 como para Opus 4.7. El mismo documento atribuye a la herramienta Code Review de Opus 4.7, cargada con el contexto completo del repositorio, la identification rétrospective du bug de cache que Opus 4.6 no había logrado producir.

Thariq Shihipar se apoya en una propiedad distinta. La salida en HTML consume más tokens que Markdown, y la ventana de contexto de 1MM de Opus 4.7 absorbe la diferencia. La generación sigue siendo entre dos y cuatro veces más lenta.

Tipo
Tecnología
capacidad
Refactor 100k líneas, encuentra zero days — pero irregular en preguntas simples
reasoning_effort_predeterminado
xhigh (tras corrección)
score_expert_pass1
48,6% (+-10,0%)
relaciones
4
Citada en
3 fiches

Vecindario

1MM context window GPT-5.5 identification rétro… Opus 4.6

→ utiliza

1MM context window CONCEPT confianza alta estable Fuente ↗

← supera

GPT-5.5 TECHNOLOGIE confianza alta estable Fuente ↗

→ resuelve

identification rétrospective du bug de cache EVENEMENT confianza alta estable Fuente ↗

→ supera

Opus 4.6 TECHNOLOGIE confianza alta estable Fuente ↗

Citada en (3)