Dritte Folge der ADLC-Serie: Williams macht das Testen zur Spezifikation in der einzigen Sprache, die der Builder nicht bestreiten kann. Während TDD bei von Menschen geschriebenem Code eine optionale Qualitätspraxis ist, wird es zum tragenden Vertrauensmechanismus des gesamten Lebenszyklus, sobald Agenten den Code schreiben. Drei „Rail-Discipline“-Regeln: getrennte Autoring-Kontexte (nur Spezifikationen vor der Implementierung), mechanisches Einfrieren auf Tool-Ebene (nicht im Prompt) und adversariale Audits („schlägt ein Test fehl, wenn das Feature entfernt wird?“). Mutationstests werden dem Coverage-Prozentsatz vorgezogen, der sich bei maschineller Geschwindigkeit leicht dem Goodhart-Effekt unterwerfen lässt.
Vierter Teil der ADLC-Reihe: Williams definiert Code-Review nicht als kollaborative Bewertung, sondern als adversarielle „Anklage“ neu. Er beauftragt Agenten mit Widerlegung („finde, was falsch ist“), setzt Single-Lens-Reviewer mit frischen Kontexten ein (Korrektheit, Sicherheit, Vertragskonformität, Spezifikationstreue, Testqualität), handelt nur bei verifizierten Befunden (durch einen fehlschlagenden Test reproduziert) und wiederholt den Zyklus, bis zwei aufeinanderfolgende Durchläufe null Befunde ergeben. Die Kalibrierung wird gemessen, indem bekannte Bugs im Stil von Mutationstests platziert werden. Exit-Kriterium: null offene Befunde, zwei trockene Durchläufe, grüne Tests, leerer Test-Diff.