Harness engineering for coding agent users
Harness engineering: un modello mentale per costruire fiducia negli agenti di coding tramite guide feedforward e sensori di feedback
Birgitta Böckeler
root / tags / revue-de-code-ia
2 fiches
Harness engineering: un modello mentale per costruire fiducia negli agenti di coding tramite guide feedforward e sensori di feedback
Birgitta Böckeler
Studio empirico del team di ingegneria di **Compare the Market** (Meerkat Careers, UK) che valuta quattro approcci al **recupero di contesto per la revisione del codice con IA**: Baseline (nessun contesto aggiuntivo), **RAG** (ricerca vettoriale), **GKG** (GitLab Knowledge Graph, grafo di conoscenza basato su AST), e **GKG+RAG** (ibrido). Valutazione su **79 merge request reali** con **MLflow su Databricks**. Risultato sorprendente: **RAG ottiene risultati peggiori della baseline** su quasi tutte le metriche — il rumore vettoriale è controproducente per la revisione del codice. **GKG supera RAG del +21%** nella copertura dei commenti inline (0,696 contro 0,577) grazie alla comprensione strutturale dell'AST (Tree-sitter + database a grafo Kuzu). Il codice richiede una comprensione **strutturale** (chiamanti, firme, gerarchie), non una semplice similarità semantica. GKG costa 4 volte la baseline ma offre miglioramenti misurabili; RAG costa 3 volte senza alcun miglioramento. Implementato come **sidecar Docker** in CI/CD che avvolge il binario GKG (ancora in beta su GitLab) con un server MCP locale.
Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).