Episodio «Fase 5 · Review» de la serie de SFEIR sobre el SDLC aumentado, publicado **el mismo día** que la publicación de Addy Osmani en LinkedIn que traduce en una especificación de fase. Tesis: **la calidad ha cambiado de dirección** — ya no se lee en el código (los agentes producen más código del que nadie puede revisar) sino en **el anillo de restricciones que rodea al agente**. El anillo de Osmani (siete dimensiones — corrección, seguridad, rendimiento, accesibilidad, mantenibilidad, **eficiencia económica**, **comprensibilidad** — enlazadas por la regla de **back-pressure**: «un bucle solo recibe la autonomía que puede verificarse de forma barata y fiable, ni un ápice más») se redibuja, se traduce y se adjunta a la fase 5 del ciclo de 11 fases de SFEIR. El corolario estructurante: **el cuello de botella nunca ha sido la generación, es la verificación** — «la generación es una boca ancha, la verificación un cuello estrecho; acelerar la boca engrosa la pila en el cuello». **La decisión de diseño más interesante es una elección de arquitectura del ciclo**: Review queda deliberadamente **fuera de las tres puertas humanas** (Define, Plan, Ship), porque convertir Review en la puerta pondría la atención humana — un recurso finito — como el punto de control de una capacidad de generación que a su vez escala: «habrías construido un pipeline cuyo rendimiento máximo es el número de diffs que un senior puede leer antes de que acabe el día». De ahí la separación: **Review instrumenta, Ship decide** — Review entrega un *cuerpo de evidencia oponible*, Ship decide sobre la evidencia, no sobre el diff completo. Una postura enfrentada a Monperrus (de quien SFEIR conserva el diagnóstico — la inspección humana de cada diff no puede resistir la velocidad agéntica — pero rechaza la conclusión: la aceptación no puede delegarse). La trampa señalada es la **validación circular** (el agente que escribe el código escribe los tests que lo validan: «has construido un espejo, no un anillo»), con cinco contramedidas extraídas de Anthropic (puertas independientes en ventanas de contexto separadas, determinista + agéntico que nunca se sustituyen entre sí, modo sombra, categorización por riesgo, registro en el SIEM) y la advertencia de Compare the Market (**grafo AST ~70% frente a RAG vectorial ~58%**, con el RAG rindiendo *peor que sin contexto alguno*). La extensión propia de la firma es **el trinquete**: «cada fuga se convierte en una restricción» — un defecto que ha cruzado el anillo se cierra *dentro del anillo* (test, regla de lint, rúbrica de revisión, guardrail del harness) en Compound-1, «el único activo de la cadena que se revaloriza mientras los modelos se deprecian» (una medición interna no auditada: **−30% de iteraciones de corrección tras diez ciclos**). Cierra reformulando la pregunta: «¿es bueno este código?» se ha vuelto una pregunta sin respuesta; lo que queda es **«¿qué se niega a dejar pasar mi sistema?»**
#anillo de restricciones#restricciones alrededor de los agentes#fase Review
SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market
Análisis de SFEIR (voz de la firma) sobre la disponibilidad general, el 9 de julio de 2026, de **GPT-5.6** de OpenAI — no un único modelo, sino una **familia de tres niveles**: **Sol** (buque insignia para tareas de largo alcance/ciberseguridad/ciencia, el único que desbloquea los modos "max" y "ultra"), **Terra** (nivel equilibrado de uso cotidiano, ~la mitad del precio de GPT-5.5) y **Luna** (rápido/económico, alto volumen). Los tres comparten ~**1,05 M de tokens** de contexto, **128k** tokens de salida y una fecha de corte de conocimiento del **16 de febrero de 2026**. El hecho más estructurante no es una puntuación, sino una **tabla de precios agresiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ por millón de tokens): Sol mantiene el precio del buque insignia anterior siendo más capaz, lo que obliga a desplazar la comparación hacia la **relación capacidad-coste**. Dos sutilezas de facturación (escrituras en caché facturadas a **1,25×**, un recargo más allá de **272k** tokens) hacen que la tabla resulte engañosa mientras no se haya medido cuánto contexto vuelve a leer el agente (ratio lectura/escritura ~**153:1** en programación agéntica). Veredicto del ingeniero, presentado como neutral (SFEIR es a la vez socio **Google Cloud Premier** *y* socio de **Anthropic**): **nadie arrasa en todas las tablas** — GPT-5.6 domina Terminal-Bench 2.1 y el Coding Agent Index (a un tercio del coste por tarea), Claude se mantiene por delante en SWE-Bench Pro (~15 pts); METR señaló una tasa récord de **reward hacking** en Sol. Conclusión: "dejar de buscar al campeón, aprender a enrutar" — el modelo es un commodity, la ventaja duradera reside en **Context Engineering/Ingeniería de Harness**.
Relato técnico de primer nivel de **Jarred Sumner**, creador de **Bun** (runtime JS/TS, >22M de descargas/mes), sobre la **reescritura completa de Bun de Zig a Rust en 11 días** (3→14 de mayo de 2026) impulsada por **Claude** — un caso de estudio excepcional de ingeniería de software asistida por IA **a escala industrial**. Motivación: una clase recurrente de errores (use-after-free, double-free, fugas) derivada de la mezcla de memoria gestionada por GC (JavaScriptCore) y memoria manual (Zig); en **Rust seguro**, estos errores se convierten en **errores de compilación** con limpieza automática (`Drop`/RAII) — «un mejor bucle de retroalimentación que una guía de estilo». Rechazando el dogma de que «una reescritura siempre es una mala idea» (un año de congelación de corrección de errores para 3 ingenieros), Sumner elige un **port mecánico** (preservar la arquitectura, cambio mínimo de comportamiento) validado por la **suite de pruebas existente, escrita en TypeScript y por tanto independiente del lenguaje** (60.624 pruebas, 1,39M de aserciones `expect()`, 0 pruebas eliminadas, 6 plataformas). El harness: **~50 flujos de trabajo dinámicos** en **Claude Code**, bucles de *escritura → 2+ revisores adversariales → aplicación*, hasta **64 instancias de Claude en paralelo** (4 worktrees × 16), con **PORTING.md** + **LIFETIMES.tsv** generados en preparación. Cifras: **6.502 commits** (pico de 695/h, 58/min, ~1.300 líneas/min), diff final **+1.009.272 líneas**, ~16.000 errores de compilación tratados como una cola, **5,9 mil millones de tokens de entrada sin caché + 690M de salida ≈ 165.000 $**. Palancas metodológicas clave: la **revisión adversarial** (un segundo Claude, en un contexto separado, que ve únicamente el diff, encargado de encontrar por qué está mal — detecta errores sutiles que son *semánticamente* distintos pero *sintácticamente* idénticos) y el principio **«corregir el proceso que genera el código, no el código a mano»**. Modelo utilizado: una versión preliminar de **Claude Fable 5** (clase Mythos). Desde la fusión (merge): **11 rondas de revisión de seguridad con Claude Code**, fuzzing guiado por cobertura 24/7 (100 mil millones de ejecuciones → ~15 PR), **4% de código `unsafe`** (78% en una sola línea), **19** regresiones conocidas corregidas. En producción: Claude Code v2.1.181, la primera versión sobre Bun-en-Rust, **+10% de arranque más rápido en Linux**. Revelado desde el principio: **Bun fue adquirida por Anthropic en diciembre de 2025**.
#Bun#Jarred Sumner#reescritura de Zig a Rust
Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)
Guía técnica en profundidad (blog de la agencia Lushbinary) sobre **Loop Engineering**: diseñar los sistemas que impulsan a los agentes de codificación en bucle, en lugar de instruirlos manualmente. Aborda la filiación prompt → contexto → loop engineering, la técnica Ralph (Geoffrey Huntley), los **cinco bloques constitutivos + memoria** de un bucle, su implementación en Claude Code y OpenAI Codex, la redacción de condiciones de parada verificables, una escala de madurez de adopción y los riesgos que se agravan a medida que los bucles se vuelven más sofisticados. Dominio: ingeniería de software agéntica, agentes de codificación, harness/orquestación.
#Loop engineering#agentes de codificación#harness engineering
Debate televisado en BFM Business (programa *Tech & Co Business*, segmento "The Debate", 17 minutos) con **Rémi Jacquet** (CEO de Cast Software France, fundador en 2023 de un think tank de un centenar de CIO sobre el impacto de la IA generativa en el desarrollo, en colaboración con Cigref / Epita) y **Didier Girard** (CTO y CEO de **SFEIR**, una empresa francesa de servicios informáticos (ESN) de unas 1.000 personas). Tesis fuertes: *"escribir código se ha convertido en un antipatrón"* (Girard), la IA produce código de mayor calidad que la mayoría de los ingenieros y es *"de 2 a 10 veces más eficiente"* — esto es una realidad, pero la profesión no está desapareciendo. El desarrollador se convierte en un **director de orquesta / gestor de agentes / árbitro**, los sprints de 14 días son reemplazados por ***bolts*** de una hora a media jornada, el **Pizza Team** (8-10 personas) ya no funciona en la era agéntica, está surgiendo un nuevo rol — el ***product engineer*** —, la vida útil de una competencia cae de **10 años a 1 año**, y el consumo de **tokens** se convierte en el *combustible* de la creación de valor (anécdota de NVIDIA que supuestamente paga bonificaciones en tokens, metáfora del taxista que no consume gasolina). SFEIR afirma *"somos 1.000 personas, con una capacidad de producción de 10.000"*. Por el lado de Cast: posicionamiento en ***harness engineering*** (IA determinista frente a probabilística, control y guardrails), alineado con la tribuna de Sylvain Duranton (BCG X) en *Les Échos* que afirma que *"un agente = un LLM + harnesses"*. Pivote histórico: 2024 *prompt engineering* → 2025 *context engineering* → 2026 *harness engineering*. Advertencia clave: *"cuanto más fuerte se vuelve la IA, más bajamos la guardia — más riesgos hay"* (Jacquet). Papel fundamental de RR. HH. en la transformación, revisión completa del SDLC, recomendación a los junior de consolidar los fundamentos de la arquitectura de software (*"el código es la partitura, hay que dominar la sinfonía"*).
#BFM Business#Tech & Co Business#debate televisado
Whitepaper de Google (la entrega "Day 1" de una serie, de Addy Osmani, Shubham Saboo y Sokratis Kartakis) que traza la transformación del ciclo de vida del desarrollo de software (SDLC) en la era de los agentes de codificación. Tesis: el cambio fundamental no es un nuevo lenguaje, sino el paso de escribir código a **expresar intención**. El documento plantea un espectro que va del *vibe coding* (proponer y aceptar) a la *agentic engineering* (la IA implementa bajo restricciones, pruebas y bucles de retroalimentación diseñados por humanos), con la **context engineering** como habilidad central, el modelo de **software factory** (el entregable del desarrollador = el sistema que produce el código), la **harness engineering** (Agente = Modelo + Harness), y un análisis económico CapEx/OpEx del coste total de propiedad.
Síntesis de Addy Osmani (Google, Chrome/Cloud) sobre el campo emergente de la *harness engineering*: la ecuación `agent = model + harness`, el principio *ratchet* ("cada error se convierte en una regla"), el replanteamiento "skill issue" de HumanLayer, la evidencia de Terminal Bench (de Top 30 a Top 5 solo con un cambio de harness), la arquitectura en capas de Claude Code, la visión de Anthropic "los harnesses no se reducen, se desplazan", y Harness-as-a-Service (Claude Agent SDK, Codex SDK, OpenAI Agents SDK). Artículo bisagra que consolida a Trivedy, HumanLayer, Anthropic y Böckeler en una doctrina.
#harness engineering#agent harness#Addy Osmani
Addy Osmani (Software Engineer at Google, Cloud + Gemini)