How Anthropic enables self-service data analytics with Claude
Informe técnico (engineering write-up) del equipo de Data Science & Data Engineering de Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), publicado el 3 de junio de 2026 en el blog de Anthropic (categoría Enterprise AI, centrado en Claude Code). Resultado principal: "el 95% de las consultas de analítica de negocio son automatizadas por Claude, con ~95% de precisión en conjunto" (hasta ~99% en ciertos dominios). Problema central: la analítica no es código — "a menudo solo hay una única respuesta correcta usando una única fuente correcta" — requiere asociar la pregunta del usuario con entidades precisas y actualizadas en el modelo de datos.
#analítica self-service#analítica de datos agéntica#Claude Code#única respuesta correcta#asociación pregunta-entidad#modelo de datos#modos de fallo#ambigüedad concepto-entidad
Publicado el 3 de junio de 2026 en el blog de Anthropic, este informe del equipo de Data Science & Data Engineering (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) describe cómo Anthropic hizo que su analítica fuera self-service con Claude: 95% de las consultas de negocio automatizadas, ~95% de precisión en conjunto (hasta ~99% en ciertos dominios).
El punto de partida es que la analítica no es código: "a menudo solo hay una única respuesta correcta usando una única fuente correcta". El reto no es la creatividad generativa sino la capacidad de asociar una pregunta con entidades precisas y actualizadas en el modelo de datos. Tres modos de fallo amenazan esto: ambigüedad concepto↔entidad (¿qué cuenta como "usuarios activos"? ¿se excluye a los fraudulentos? ¿qué ventana?), obsolescencia (staleness) de los activos y del conocimiento del agente, y fallo de recuperación — el 80% de las consultas fallidas tenían igualmente la información presente en el corpus. El peor caso es el fallo silencioso: una respuesta incorrecta pero plausible, usada sin objeción.
La respuesta es una "pila de analítica agéntica" de cuatro capas. (1) Fundamentos de datos: modelado dimensional, conjuntos de datos canónicos"fuente única de verdad", metadatos tratados "como producto de primera clase", integridad vía CI/CD. (2) Fuentes de verdad en orden decreciente de confianza: una semantic layer que el agente está "estructuralmente obligado (por instrucción de la skill) a recurrir primero", después el linaje, un corpus de consultas destilado en documentos (no recuperación en bruto), y un grafo de conocimiento de negocio (hojas de ruta, registros de decisiones, organización). (3) Skills — la palanca decisiva: "sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%". Se organizan en pares: una Knowledge skill enrutadora (~30 archivos de referencia) y una Unbook skill que codifica el flujo de trabajo del analista senior (aclarar, buscar fuentes, ejecutar, revisión adversarial). El mantenimiento está colocalizado: un hook de revisión señala cualquier cambio de modelo sin el cambio de skill correspondiente — ~90% de las PR de datos ahora incluyen una skill en el mismo diff. (4) Validación: evaluaciones offline con umbral (~90% para autorizar un agente), pruebas de ablación, y salvaguardas online (revisión adversarial: +6% de precisión pero +32% de tokens y +72% de latencia; pies de página de procedencia; recolección de correcciones por agentes programados).
Dos resultados negativos dan forma a la doctrina: dar acceso mediante grep en bruto a miles de archivos SQL mueve la precisión "menos de un punto" (el cuello de botella es la estructura, no el acceso), y dejar que el LLM defina las métricas fue "netamente negativo" — de ahí la regla: documentación generada, definiciones propiedad de los humanos. Para empezar: un puñado de conjuntos de datos canónicos, unas pocas docenas de evaluaciones, una thin knowledge skill.
Puntos clave
Fecha / fuente.3 de junio de 2026, blog de Anthropic (claude.com/blog, Enterprise AI). Autores: el equipo de Data Science & Data Engineering de Anthropic (Chang, Peng, Leder, Jiao, Cherry).
Resultado principal.95% de las consultas de analítica de negocio automatizadas, ~95% de precisión en conjunto (hasta ~99% en ciertos dominios).
Tesis. analítica ≠ código — "solo hay una única respuesta correcta usando una única fuente correcta" → el reto es asociar la pregunta con las entidades correctas y actuales, no generar. ### 3 modos de fallo 1. Ambigüedad concepto↔entidad — cientos de opciones; p. ej. "usuarios activos" (¿qué acciones? ¿se excluye a los fraudulentos? ¿qué ventana de retrospección?). 2. Obsolescencia (staleness) — los activos y el conocimiento del agente se vuelven "sutilmente incorrectos" (los esquemas/definiciones cambian continuamente). 3. Fallo de recuperación — el 80% de las consultas fallidas tenían la información presente en el corpus de todos modos.
Peligro último = fallo silencioso: "la respuesta es incorrecta, pero parece plausible y se usa sin objeción". ### Pila agéntica de 4 capas
L1 — Fundamentos de datos. modelado dimensional, conjuntos de datos canónicos (fuente única de verdad, con propietario, listos para consumo), metadatos como "producto de primera clase", integridad entre capas vía CI/CD.
L2 — Fuentes de verdad. (confianza ↓): semantic layer (obligatoria en primer lugar) → grafo de linaje/transformación → corpus de consultas (destilado en documentos, no recuperación en bruto) → contexto de negocio (grafo de conocimiento: hojas de ruta, registros de decisiones, organización).
L3 — Skills. (la palanca): 21% → 95%+. Pares: Knowledge skill (enrutador → ~30 archivos de referencia) + Unbook skill (flujo de trabajo del analista senior: aclarar → fuentes → ejecutar → revisión adversarial; patrones reutilizables: curvas de retención, descomposición de tasas, funnel). Esqueleto de documento típico: Referencia rápida / Dimensiones y tablas clave / Gotchas / Buenas prácticas y patrones de consulta / Referencias entre dominios.
L4 — Validación. evaluaciones offline (umbral ~90% para autorizar un agente, objetivo ~100%, ground truth fijado sobre un snapshot, "almacenar los resultados como telemetría"), pruebas de ablación, online (revisión adversarial, pies de página de procedencia, controles de calidad de datos, recolección de correcciones por agentes programados). ### Resultados destacados (cifras y ablaciones)
Sin skills ≤ 21%. ; con skills > 95% (≈99% en ciertos dominios).
Revisión adversarial.+6% de precisión, pero +32% de tokens y +72% de latencia (una contrapartida que hay que aceptar).
Ablación de grep en bruto. (miles de archivos SQL accesibles): la precisión se mueve "menos de un punto" → el cuello de botella es la estructura, no el acceso.
Definiciones generadas por el LLM. = "netamente negativo" (codifican precisamente las ambigüedades que se pretendía eliminar) → definiciones propiedad de los humanos.
Recuperación no estructurada. sobre miles de consultas: ganancia < 1 punto → el corpus debe ser destilado, no buscado en bruto.
Mantenimiento. hook de revisión de código → ~90% de las PR de datos tocan un archivo de skill en el mismo diff. ### Para usar en misiones / presentaciones
Plano de agente de analítica en producción. transferible a otros contextos: gobernanza de datos + semantic layer obligatoria + skills + evaluaciones con umbral.
Punto de partida mínimo. (reutilizable tal cual): "un puñado de conjuntos de datos canónicos, unas pocas docenas de evaluaciones offline y una thin knowledge skill" capturan "la mayor parte del beneficio".
Argumentos anti-RAG-ingenuo. los dos resultados negativos (grep en bruto, recuperación no estructurada) son munición contra "simplemente darle todo al agente".
Métrica de gobernanza viva."el 90% de las PR incluyen una skill" = prueba de que la documentación y el código evolucionan juntos (anti-obsolescencia).
Conecta con: skills (Shihipar/Anthropic), semantic layer/ontología (Talisman, Seale), context engineering (Debois/Tessl), systems around the model (Dropbox), datos de grafo de conocimiento (Netflix UDA).
Cifras clave
95 % de las consultas de analítica de negocio automatizadas vía Claude