# comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06

## Veille

Estudio empírico del equipo de ingeniería de **Compare the Market** (Meerkat Careers, Reino Unido) que evalúa cuatro enfoques para la **recuperación de contexto en revisión de código con IA**: Baseline (sin contexto adicional), **RAG** (búsqueda vectorial), **GKG** (GitLab Knowledge Graph, grafo de conocimiento basado en AST) y **GKG+RAG** (híbrido). Evaluación sobre **79 merge requests reales** con **MLflow en Databricks**. Resultado llamativo: **RAG rinde peor que el baseline** en casi todas las métricas — el ruido vectorial resulta contraproducente para la revisión de código. **GKG supera a RAG en un +21%** en cobertura de comentarios en línea (0,696 frente a 0,577) gracias a la comprensión estructural mediante AST (Tree-sitter + base de datos de grafos Kuzu). El código requiere comprensión **estructural** (llamadores, firmas, jerarquías), no una mera similitud semántica. GKG cuesta 4 veces el baseline pero aporta mejoras medibles; RAG cuesta 3 veces sin mejora alguna. Implementado como **sidecar Docker** en CI/CD que envuelve el binario de GKG (aún en beta en GitLab) con un servidor MCP local.

## Titre Article

Comparing Context Retrieval Approaches for AI Code Review

## Date

2026-03-06

## URL

https://comparethemarketcareers.com/blog/comparing-context-retrieval-approaches-for-ai-code-review/

## Keywords

Compare the Market, Meerkat Careers, revisión de código con IA, recuperación de contexto, RAG, GKG, GitLab Knowledge Graph, AST, Tree-sitter, Kuzu, grafo de conocimiento de código, MLflow, Databricks, merge requests, evaluación empírica, cobertura de comentarios en línea, similitud semántica frente a estructural, sidecar Docker CI/CD, servidor MCP local, ruido vectorial contraproducente, revisión de código automatizada, eficiencia de coste de revisión con IA, RAG peor que el baseline, enfoque estructural del código

## Authors

Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).

## Ton

**Perfil**: Artículo técnico publicado en el blog de empleo de Compare the Market (marca Meerkat Careers, Reino Unido), una empresa de comparación de precios al consumidor. Un formato de ingeniería interna compartido públicamente — el tono es el de un equipo que realizó una evaluación rigurosa y comparte los resultados sin adornos. Público destinatario: ingenieros de software, DevOps, equipos de calidad de software que buscan dotar de herramientas de IA a su revisión de código, arquitectos que evalúan RAG frente a enfoques estructurales para el código.

**Estilo**: Registro técnico empírico, centrado en los datos. El artículo procede de forma metódica: hipótesis → configuración experimental (4 enfoques, 79 MRs, MLflow/Databricks) → métricas → resultados → análisis de causas → recomendaciones. Sin exageraciones ni promesas de marketing: los resultados negativos de RAG se presentan sin rodeos, sin ningún intento de suavizarlos. El estilo es el de un informe de ingeniería interno hecho público — factual, estructurado, con tablas de métricas. La autoridad proviene de los datos, no de la retórica.

**Posición epistémica**: honestidad empírica. El artículo no intenta vender GKG como una solución milagrosa — reconoce la sobrecarga de 4 veces y el estado beta de GKG. El resultado negativo sobre RAG es el hallazgo más destacado: demostrar que un enfoque popular es contraproducente en un caso de uso concreto resulta más útil que promover la alternativa. La arquitectura de sidecar Docker se describe como una solución pragmática (GKG aún no integrado de forma nativa en GitLab CI/CD).

## Pense-betes

- **Fecha / fuente**: 6 de marzo de 2026, blog de Meerkat Careers (Compare the Market, Reino Unido). Autor: equipo de ingeniería (nombre(s) individual(es) no disponible(s) — sitio bloqueado 403, entrada basada en contenido indexado por motores de búsqueda y fuentes secundarias).
- **Problema abordado**: ¿cuál es la mejor manera de proporcionar contexto de la base de código a un revisor de IA? ¿Es suficiente la similitud semántica (RAG), o se requiere una comprensión estructural del código (AST/grafo)?
- **4 enfoques evaluados**: 1. **Baseline** — sin contexto adicional, el modelo de IA solo ve el diff del MR. 2. **RAG** (Retrieval-Augmented Generation) — fragmentación del código, embeddings, búsqueda vectorial para recuperar fragmentos semánticamente similares. 3. **GKG** (GitLab Knowledge Graph) — análisis AST mediante **Tree-sitter** (`gitlab-code-parser`), grafo de conocimiento estructurado almacenado en **Kuzu** (base de datos de grafos), consultas estructurales (llamadores, jerarquía de clases, firmas de funciones). 4. **GKG+RAG** (híbrido) — combinación de ambos enfoques.
- **Métricas clave sobre 79 merge requests** (evaluadas mediante **MLflow en Databricks**): | Métrica | GKG | RAG | Diferencia | |----------|-----|-----|-------| | Inline Comments Coverage | **0,696** | 0,577 | **+21%** | | Summary Coverage | **0,681** | 0,664 | +3% | | Issue Coverage | **0,929** | 0,926 | marginal | | Score Accuracy | **GKG mejor** | RAG peor que el baseline | — |
- **Hallazgo principal: RAG rinde peor que el baseline** en casi todas las métricas. Añadir contexto ruidoso resulta contraproducente.
- **4 causas identificadas del fracaso de RAG en la revisión de código**: 1. **Ruido** — la similitud vectorial recupera código que "parece similar" pero no es relevante. 2. **Falsos positivos** — RAG encuentra funciones no relacionadas con el cambio. 3. **Limitación por archivo** — RAG no comprende las relaciones entre archivos. 4. **Efecto de distracción** — el contexto adicional puede inducir a error al modelo en lugar de ayudarlo.
- **Por qué funciona GKG**: la revisión de código requiere comprensión **estructural** — al revisar un cambio en una función, hay que saber **quién la llama**, **a qué llama** y **cómo encaja en la arquitectura**. GKG identifica con precisión los llamadores, comprende las firmas y traza las relaciones del código. Se trata de **navegación estructural**, no de **similitud semántica**.
- **Implementación técnica**: GKG aún en beta, todavía no disponible como función nativa de GitLab CI/CD → el equipo construyó un **sidecar Docker**: un contenedor ligero que envuelve el binario oficial de GKG, montado junto al revisor en el pipeline de CI. En cada pipeline de MR: (1) el sidecar monta el código fuente del proyecto, (2) indexa la base de código completa y construye el grafo de conocimiento desde cero, (3) inicia el **servidor MCP de GKG** en un puerto local, (4) expone un conjunto de tool calls a los que se conecta el revisor de IA.
- **Análisis coste-beneficio**:
- GKG: **4 veces el coste del baseline** → mejoras medibles y justificadas.
- RAG: **3 veces el coste del baseline** → resultados peores que no añadir nada.
- GKG+RAG: coste acumulado sin beneficio adicional frente a GKG solo.
- **Conclusión**: si la calidad es prioritaria, usar GKG. Evitar RAG y GKG+RAG.
- **Conexiones con otras fichas de veille**:
- **Fuerte convergencia** con la doctrina *"grep gana cuando sabes lo que buscas, AST gana cuando necesitas relaciones estructurales"* — una tendencia de 2026 confirmada por las prácticas de Cursor, Claude Code, Devin (cf. MindStudio *"Coding Agents Skipped RAG"*).
- Se alinea con **Zhutov/QMD** (2026-03-01) sobre la superioridad de la búsqueda estructurada frente a la búsqueda vectorial para el código.
- Amplía **Trivedy/LangChain** (2026-03-10) *Anatomy of an Agent Harness*: el harness (aquí, el sidecar GKG + MCP) importa más que el modelo.
- Se alinea con **Dropbox/Okumura** (2026-05-28) *"el valor proviene menos del propio modelo que de los sistemas que lo rodean"* — el contexto estructural marca la diferencia, no el LLM.
- Complementa la ficha de **MCP**: GKG expuesto mediante un servidor MCP local, lo que confirma el patrón de sidecar MCP en CI/CD.
- Corrobora a **Anthropic Data Science** (2026-06-03): *"grep bruto sobre miles de archivos SQL → la precisión solo se mueve un punto"* — el cuello de botella es la estructura, no el acceso.
- Refuerza la tesis anti-RAG-ingenuo de **Seale** (2025-05-30) *Philosophy Eats AI*: la ontología (aquí, el AST) prevalece sobre la similitud.
- **Uso previsto**: decisiones de arquitectura de revisión de código con IA en entornos empresariales; argumento contra el RAG por defecto para código; diseño de pipelines de CI/CD aumentados por agentes; evaluación de herramientas de contexto de código (GKG, CodeGraphContext, code-review-graph).
- **Limitaciones**: (a) 79 MRs = tamaño de muestra modesto; (b) una única base de código (Compare the Market) — sesgo de representatividad; (c) GKG aún en beta, todavía no validado a gran escala; (d) autor(es) no identificado(s) — sitio bloqueado 403; (e) sin comparación con otros enfoques estructurales (Augment Context Engine, CodeGraphContext, etc.).
- **Enlace corto de LinkedIn**: el enlace `lnkd.in/dacPc6fM` (pendiente desde 2026-05-15) apunta a este artículo.

## RésuméDe400mots

El equipo de ingeniería de **Compare the Market** (Meerkat Careers, Reino Unido) publicó, el 6 de marzo de 2026, una evaluación empírica de cuatro enfoques de recuperación de contexto para la **revisión de código con IA**: Baseline (sin contexto adicional), **RAG** (búsqueda vectorial mediante embeddings), **GKG** (GitLab Knowledge Graph, un grafo de conocimiento basado en AST mediante Tree-sitter y la base de datos de grafos Kuzu), y un híbrido **GKG+RAG**. La evaluación abarca **79 merge requests reales**, medidos mediante **MLflow en Databricks**.

El hallazgo principal es contraintuitivo: **RAG rinde peor que el baseline** en casi todas las métricas, incluyendo la cobertura de comentarios en línea, la cobertura de resúmenes y la precisión de la puntuación. Añadir contexto recuperado por similitud vectorial no solo es inútil, sino **contraproducente** para la revisión de código. Se identifican cuatro causas: el **ruido** (la similitud vectorial recupera código que "parece similar" sin ser relevante), los **falsos positivos**, la falta de comprensión de las **relaciones entre archivos**, y un **efecto de distracción** que induce a error al modelo.

Por el contrario, **GKG supera a RAG en un +21%** en cobertura de comentarios en línea (0,696 frente a 0,577). La razón es estructural: la revisión de código requiere saber **quién llama a una función**, a qué llama y cómo encaja en la arquitectura — información que el AST y el grafo de conocimiento capturan de forma nativa, pero que la similitud semántica no puede proporcionar. GKG identifica con precisión los llamadores, comprende las firmas de las funciones y traza las relaciones del código.

La implementación es pragmática: dado que GKG sigue en beta y aún no está integrado de forma nativa en GitLab CI/CD, el equipo construyó un **contenedor sidecar Docker** que envuelve el binario de GKG, indexa la base de código en cada pipeline de MR, y expone las herramientas mediante un **servidor MCP local**. El coste es 4 veces el del baseline, pero las mejoras son medibles y justificadas. RAG cuesta 3 veces el baseline para obtener peores resultados.

Este estudio confirma una tendencia importante de 2026: para el código, los enfoques **estructurales** (AST, grafos de conocimiento, grep dirigido) superan a los enfoques **vectoriales** (RAG semántico). El código no es texto — su valor informativo reside en sus **relaciones estructurales**, no en su similitud léxica. Fuerte convergencia con Zhutov/QMD, Dropbox/Okumura (*"el valor proviene de los sistemas que rodean al modelo"*), y la doctrina de Anthropic Data Science (*"el cuello de botella es la estructura, no el acceso"*). A utilizar como referencia empírica para decisiones de arquitectura de revisión de código con IA y como contraargumento al RAG por defecto en el ámbito del código.

## GrapheDeConnaissance

- Compare the Market —a_créé→ évaluation empirique revue de code IA (EVENEMENT, 0.95)
- GKG —surpasse→ RAG (TECHNOLOGIE, 0.97)
- GKG —mesure→ 0,696 inline comments coverage vs RAG 0,577 (+21 %) (MESURE, 0.96)
- RAG —mesure→ performance pire que baseline sur presque toutes les métriques (MESURE, 0.96)
- GKG —utilise→ Tree-sitter (TECHNOLOGIE, 0.95)
- GKG —utilise→ Kuzu (TECHNOLOGIE, 0.94)
- GKG —est_instance_de→ GitLab Knowledge Graph (TECHNOLOGIE, 0.97)
- Compare the Market —affirme_que→ le code exige une compréhension structurelle, pas une similarité sémantique (AFFIRMATION, 0.95)
- RAG —réduit→ qualité de la revue de code IA (bruit vectoriel contre-productif) (AFFIRMATION, 0.94)
- GKG —permet→ identification précise des appelants, signatures, hiérarchies de code (CONCEPT, 0.95)
- évaluation empirique revue de code IA —utilise→ MLflow (TECHNOLOGIE, 0.93)
- évaluation empirique revue de code IA —mesure→ 79 merge requests évaluées (MESURE, 0.95)
- Compare the Market —a_créé→ GKG (TECHNOLOGIE, 0.92)
- GKG —utilise→ serveur MCP local (TECHNOLOGIE, 0.92)
- GKG —mesure→ coût 4× baseline avec améliorations mesurables (MESURE, 0.93)

---
Canonical: https://www.thekb.eu/es/fiches/comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06/
