Zum Inhalt springen

root / tags / compare-the-market

#Compare the Market

2 Fiches

Qualität & Sicherheit Automatisch geprüfte Übersetzung

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Episode "Phase 5 · Review" der SFEIR-Reihe zum erweiterten SDLC, veröffentlicht **am selben Tag** wie der LinkedIn-Beitrag von Addy Osmani, den sie in eine Phasenspezifikation übersetzt. These: **Qualität hat die Adresse gewechselt** — sie wird nicht mehr im Code gelesen (Agenten produzieren mehr davon, als irgendjemand reviewen kann), sondern in **dem Ring von Constraints, der den Agenten umgibt**. Osmanis Ring (sieben Dimensionen — Korrektheit, Sicherheit, Performance, Barrierefreiheit, Wartbarkeit, **wirtschaftliche Effizienz**, **Verständlichkeit** — verbunden durch die **Back-Pressure**-Regel: „einer Schleife wird nur so viel Autonomie zugestanden, wie günstig und zuverlässig verifiziert werden kann, keinen Zentimeter mehr") wird nachgezeichnet, übersetzt und an Phase 5 des 11-Phasen-Zyklus von SFEIR angehängt. Das strukturierende Korollar: **der Engpass war nie die Generierung, es ist die Verifikation** — „Generierung ist ein weiter Trichtermund, Verifikation ein enger Hals; wer den Mund beschleunigt, verdickt den Stau am Hals." **Die interessanteste Design-Entscheidung ist eine Wahl der Zyklusarchitektur**: Review liegt bewusst **außerhalb der drei menschlichen Gates** (Define, Plan, Ship), denn würde man Review zum Gate machen, würde menschliche Aufmerksamkeit — eine endliche Ressource — zum Kontrollpunkt einer Generierungskapazität, die selbst skaliert: „man hätte eine Pipeline gebaut, deren maximaler Durchsatz der Anzahl an Diffs entspricht, die ein Senior bis Feierabend lesen kann." Daher die Aufteilung: **Review instrumentiert, Ship entscheidet** — Review liefert einen *widerlegbaren Beweiskörper*, Ship entscheidet anhand der Evidenz, nicht anhand des vollständigen Diffs. Eine Position, die sich gegen Monperrus stellt (von dem SFEIR die Diagnose übernimmt — menschliche Inspektion jedes Diffs hält der agentischen Geschwindigkeit nicht stand —, aber die Schlussfolgerung ablehnt: Abnahme kann nicht delegiert werden). Die benannte Falle ist die **zirkuläre Validierung** (der Agent, der den Code schreibt, schreibt auch die Tests, die ihn validieren: „man hat einen Spiegel gebaut, keinen Ring"), mit fünf Gegenmaßnahmen von Anthropic (unabhängige Gates in getrennten Context-Windows, deterministisch + agentisch ersetzen sich nie gegenseitig, Shadow Mode, risikobasierte Stufung, Logging ans SIEM) und der Warnung von Compare the Market (**AST-Graph ~70 % vs. Vektor-RAG ~58 %**, wobei RAG *schlechter abschneidet als gar kein Kontext*). Die eigene Erweiterung der Firma ist **das Ratschenprinzip**: „jedes Entkommen wird zum Constraint" — ein Defekt, der den Ring durchbrochen hat, wird *innerhalb des Rings* geschlossen (Test, Lint-Regel, Review-Rubrik, Harness-Guardrail) bei Compound-1, „das einzige Asset in der Kette, das an Wert gewinnt, während die Modelle an Wert verlieren" (eine ungeprüfte interne Messung: **−30 % Fix-Iterationen nach zehn Zyklen**). Sie schließt mit einer Neuformulierung der Frage: „Ist dieser Code gut?" ist unbeantwortbar geworden; was bleibt, ist **„Was lässt mein System nicht durch?"**

#Ring von Constraints#Constraints um Agenten#Review-Phase

SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market

Qualität & Sicherheit Automatisch geprüfte Übersetzung

Comparing Context Retrieval Approaches for AI Code Review

Empirische Studie des Engineering-Teams von **Compare the Market** (Meerkat Careers, UK) zur Bewertung von vier Ansätzen für **Context Retrieval beim KI-Code-Review**: Baseline (kein zusätzlicher Kontext), **RAG** (Vektorsuche), **GKG** (GitLab Knowledge Graph, AST-basierter Wissensgraph) und **GKG+RAG** (hybrid). Auswertung anhand von **79 realen Merge Requests** mit **MLflow auf Databricks**. Auffälliges Ergebnis: **RAG schneidet schlechter ab als die Baseline** bei fast allen Metriken — Vektor-Rauschen wirkt sich beim Code-Review kontraproduktiv aus. **GKG übertrifft RAG um +21 %** bei der Inline-Comments-Abdeckung (0,696 vs. 0,577) durch strukturelles AST-Verständnis (Tree-sitter + Kuzu-Graphdatenbank). Code erfordert **strukturelles** Verständnis (Aufrufer, Signaturen, Hierarchien), nicht bloße semantische Ähnlichkeit. GKG kostet das 4-Fache der Baseline, liefert aber messbare Verbesserungen; RAG kostet das 3-Fache ohne Verbesserung. Implementiert als **Docker-Sidecar** in CI/CD, der die GKG-Binary (noch in der GitLab-Beta) mit einem lokalen MCP-Server umschließt.

#Compare the Market#Meerkat Careers#KI-Code-Review

Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).