# williams-adlc-4-prosecution-not-code-review-2026-06-12

## Veille

Cuarta entrega de la serie ADLC: Williams replantea la revisión de código como una "acusación" adversarial en lugar de una evaluación colaborativa. Encarga a los agentes que refuten ("encontrar qué está mal"), despliega revisores de lente única con contextos nuevos (corrección, seguridad, cumplimiento del contrato, alineación con la especificación, calidad de las pruebas), actúa solo sobre hallazgos verificados (reproducidos mediante una prueba que falla) y repite el ciclo hasta que dos pasadas consecutivas arrojen cero hallazgos. Mide la calibración plantando errores conocidos, al estilo de las pruebas de mutación. Puerta de salida: cero hallazgos abiertos, dos pasadas en seco, pruebas en verde, diff de pruebas vacío.

## Titre Article

Prosecution, Not Code Review

## Date

2026-06-12

## URL

https://www.voodootikigod.com/adlc-4-prosecution-not-code-review

## Keywords

ADLC, acusación, revisión adversarial, refutación frente a evaluación, adulación, alucinación de hallazgos, sesgo de parada en quince hallazgos, revisores de lente única, contextos nuevos, hallazgos verificados, modificación fantasma, ciclo hasta agotamiento, calibración de la revisión, errores plantados, recall por categoría, falsos positivos, puerta de salida, pruebas de mutación

## Authors

Chris Williams (@voodootikigod)

## Ton

Perfil: defensa metodológica (perspectiva de practicante en inglés, registro argumentativo e incisivo), alto nivel técnico, público objetivo de líderes de calidad e ingenieros que construyen conjuntos de revisión agénticos. El tono es de recalificación conceptual: la metáfora judicial (acusación, carga de la prueba, hallazgos verificados) estructura toda la pieza y desplaza la expectativa de una revisión que "da una opinión" hacia una que "demuestra una falla reproducible". La autoridad se apoya en un anclaje explícito en modos de fallo (F2 adulación, F4 alucinación, F6 sesgo del recuento de hallazgos) y en un requisito de medición raramente aplicado — "prácticamente todos los equipos confían ciegamente en su conjunto de revisión". Estilo estructurado en torno a principios numerados, un ejemplo concreto de error plantado (una comprobación de veracidad que omite la verificación) y un cierre con una puerta de salida estricta y verificable.

## Pense-betes

- **Replanteamiento central**: la revisión de código no es una evaluación colaborativa sino una **acusación** adversarial. Cuando se les pide una revisión convencional, los modelos muestran adulación, hallazgos alucinados y un punto de parada artificial alrededor de los quince problemas.
- **1. Refutación en lugar de evaluación**: en vez de pedir retroalimentación, encarga al agente que "encuentre qué está mal" o que explique cómo fallaría el proyecto. Esto redirige el sesgo de adulación (F2) hacia la identificación de fallas en lugar de la búsqueda de aprobación.
- **2. Acusación de lente única**: despliega revisores paralelos con contextos nuevos, cada uno examinando **una sola** dimensión — corrección, seguridad, cumplimiento del contrato, alineación con la especificación o calidad de las pruebas. Distribuir las preocupaciones evita la saturación de contexto que diluye el juicio.
- **3. Solo hallazgos verificados**: antes de que los constructores actúen, exige una verificación independiente — reproducir el error mediante una prueba que falla, rastrear las rutas del código o generar la entrada que lo desencadena. Los "hallazgos no verificados" (F4) provocan una modificación real de código para problemas fantasma.
- **4. Ciclo hasta agotamiento**: vuelve a ejecutar la acusación con contextos nuevos hasta que **dos pasadas consecutivas** no arrojen ningún hallazgo verificado. Este enfoque basado en muestreo derrota a F6 (el prior de entrenamiento que se detiene alrededor de 10-20 hallazgos sin importar el número real de defectos).
- **Medición de la calibración**: prácticamente todos los equipos confían ciegamente en su conjunto de revisión. La solución refleja las pruebas de mutación: plantar errores conocidos (mutaciones mecánicas + errores sutiles escritos por un LLM), ejecutar todo el conjunto de acusación, medir el recall por categoría y la tasa de falsos positivos.
- **Ejemplo de error plantado**: añadir una comprobación de veracidad que omite la verificación cuando falta un campo — con apariencia defensiva, pero que introduce una degradación de seguridad.
- **Puerta de salida**: la revisión pasa cuando (1) cero hallazgos verificados abiertos, (2) dos pasadas en seco consecutivas, (3) conjuntos de pruebas en verde, (4) diff de pruebas **vacío** (prueba de que los constructores no modificaron sus propias puertas de control).

## RésuméDe400mots

La cuarta entrega reinventa la revisión de código para el mundo agéntico. La observación de partida: cuando se pide a los modelos que realicen una revisión convencional, decepcionan de maneras predecibles. La adulación (F2) los empuja a aprobar en lugar de criticar; la alucinación (F4) los lleva a inventar problemas; y un sesgo de entrenamiento (F6) hace que se detengan alrededor de los quince hallazgos, sin importar la densidad real de defectos. Williams extrae de esto un replanteamiento: lo que se necesita no es una evaluación, sino una acusación — una imputación adversarial.

Cuatro principios estructuran esta acusación. Primero, refutación en lugar de evaluación: en vez de pedir retroalimentación, se encarga al agente que "encuentre qué está mal" o que explique cómo fallaría el proyecto. El sesgo de adulación, así invertido, juega a favor. Luego, la acusación de lente única: en lugar de un único revisor omnisciente, se despliegan agentes paralelos con contextos nuevos, cada uno dedicado a una sola dimensión — corrección, seguridad, cumplimiento del contrato, alineación con la especificación, calidad de las pruebas. Distribuir las preocupaciones evita la saturación de contexto que diluye el juicio entre prioridades competidoras.

El tercer principio son los hallazgos verificados únicamente. Antes de que un constructor actúe sobre una crítica, esta debe probarse de forma independiente: reproducir el error mediante una prueba que falla, rastrear la ruta del código o producir la entrada que lo desencadena. Sin esto, los hallazgos alucinados generan una modificación real de código para problemas que no existen. El cuarto principio es el ciclo hasta agotamiento: la acusación se vuelve a ejecutar con contextos nuevos hasta que dos pasadas consecutivas no arrojen ningún hallazgo verificado. Este muestreo repetido derrota el punto de parada artificial de F6.

Williams señala entonces un punto ciego casi universal: prácticamente todos los equipos confían ciegamente en su conjunto de revisión, sin medir nunca su capacidad de detección real. Su solución refleja las pruebas de mutación aplicadas a los revisores: plantar errores conocidos — mutaciones mecánicas más errores sutiles escritos por un LLM —, ejecutar todo el conjunto de acusación y luego medir el recall por categoría y la tasa de falsos positivos. Ejemplo de error plantado: una comprobación de veracidad que omite la verificación cuando falta un campo, con apariencia defensiva pero que introduce una falla de seguridad.

Por último, la puerta de salida es estricta y totalmente verificable: cero hallazgos verificados abiertos, dos pasadas en seco consecutivas, conjuntos de pruebas en verde y un diff de pruebas vacío — esta última condición demuestra que los constructores no modificaron sus propias puertas de control para pasarlas.

## GrapheDeConnaissance

- Chris Williams —publie→ Prosecution, Not Code Review (DOCUMENT, 0.97)
- prosecution —s_oppose_à→ revue de code collaborative (METHODOLOGIE, 0.92)
- prosecution —réduit→ sycophancie du reviewer (CONCEPT, 0.91)
- reviewers mono-lentille —réduit→ saturation de contexte qui dilue le jugement (CONCEPT, 0.9)
- findings vérifiés —réduit→ churn de code sur des problèmes hallucinés (CONCEPT, 0.91)
- loop-until-dry —réduit→ biais d'arrêt autour de 10-20 findings (CONCEPT, 0.9)
- calibration de revue —s_inspire_de→ mutation testing (METHODOLOGIE, 0.9)
- calibration de revue —mesure→ recall par catégorie et taux de faux positifs de la stack (MESURE, 0.88)
- Chris Williams —affirme_que→ presque toutes les équipes font confiance à leur stack de revue à l'aveugle (AFFIRMATION, 0.89)
- bugs plantés —permet→ mesure de la capacité réelle de détection des reviewers (CONCEPT, 0.88)
- phase Prosecute —fait_partie_de→ cycle agentique en huit phases (METHODOLOGIE, 0.9)
- gate de sortie de prosecution —utilise→ diff de tests vide comme preuve de non-altération (CONCEPT, 0.89)

---
Canonical: https://www.thekb.eu/es/fiches/williams-adlc-4-prosecution-not-code-review-2026-06-12/
