# anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03

## Veille

Informe técnico (engineering write-up) del equipo de **Data Science & Data Engineering** de Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), publicado el **3 de junio de 2026** en el blog de Anthropic (categoría *Enterprise AI*, centrado en **Claude Code**). **Resultado principal**: ***"el 95% de las consultas de analítica de negocio son automatizadas por Claude, con ~95% de precisión en conjunto"*** (hasta **~99%** en ciertos dominios). **Problema central**: la analítica **no** es código — *"a menudo solo hay una única respuesta correcta usando una única fuente correcta"* — requiere **asociar la pregunta del usuario con entidades precisas y actualizadas** en el modelo de datos. Tres **modos de fallo**: (1) **ambigüedad concepto↔entidad** (p. ej. *"usuarios activos"*: ¿qué acciones? ¿se excluye a los fraudulentos? ¿qué ventana temporal?); (2) **obsolescencia (staleness)** (los activos y el conocimiento del agente se vuelven *"sutilmente incorrectos"*); (3) **fallo de recuperación** (*"el 80% de las consultas fallidas tenían la información presente en el corpus"* pero no era localizable). **Solución = una "pila de analítica agéntica" de 4 capas**: (L1) **Fundamentos de datos** — modelado dimensional, **conjuntos de datos canónicos** *"fuente única de verdad"*, metadatos *"como producto de primera clase"*, integridad vía CI/CD; (L2) **Fuentes de verdad** en orden decreciente de confianza — **semantic layer** (el agente está *"estructuralmente obligado (por instrucción de la skill) a recurrir primero a la semantic layer"*), grafo de linaje, **corpus de consultas** (destilado en documentos estructurados, **no** recuperación en bruto), contexto de negocio (grafo de conocimiento: hojas de ruta, registros de decisiones, organización); (L3) **Skills** — la palanca decisiva: ***"sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%"***; estructuradas **en pares** (*Knowledge skill* = enrutador hacia ~30 archivos de referencia; *Unbook skill* = flujo de trabajo de analista senior: aclarar → buscar fuentes → ejecutar → **revisión adversarial**); mantenimiento **colocalizado** (*"un hook de revisión de código señala cualquier cambio del modelo de reporting que no toque un archivo de skill"* → **~90% de las PR de datos incluyen un cambio de skill**); (L4) **Validación** — evaluaciones offline (umbral ~90% para lanzar un agente, objetivo ~100%), **pruebas de ablación** (resultado negativo notable: grep en bruto sobre miles de archivos SQL → la precisión se mueve *"menos de un punto"*), online (revisión adversarial: **+6% de precisión, +32% de tokens, +72% de latencia**), **pies de página de procedencia** (nivel de fuente + frescura + propiedad), **recolección activa de correcciones** (agentes programados que escanean canales para redactar correcciones en markdown). **Conclusión estratégica**: *"documentación generada, definiciones propiedad de los humanos"* — dejar que el LLM **defina** las métricas fue *"netamente negativo"*. **Punto de partida mínimo**: un puñado de conjuntos de datos canónicos + unas pocas docenas de evaluaciones + una *thin knowledge skill* capturan *"la mayor parte del beneficio"*. Converge fuertemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = carpetas, Gotchas, hooks), la doctrina de *systems around the model* de [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], la **semantic layer / ontología** de talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 y seale-semantic-agent-model-harness-ontology-data-2026-04-17, el *context development lifecycle* de debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, y la UDA/grafo de conocimiento de netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

## Titre Article

How Anthropic enables self-service data analytics with Claude

## Date

2026-06-03

## URL

https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude

## Keywords

analítica self-service, analítica de datos agéntica, Claude Code, única respuesta correcta, asociación pregunta-entidad, modelo de datos, modos de fallo, ambigüedad concepto-entidad, usuarios activos, obsolescencia de activos, obsolescencia de datos, fallo de recuperación, pila de analítica agéntica, fundamentos de datos, modelado dimensional, conjuntos de datos canónicos, fuente única de verdad, metadatos como producto de primera clase, linaje, semantic layer, estructuralmente obligado, corpus de consultas, grafo de conocimiento de negocio, registros de decisiones, skills, knowledge skill, unbook skill, enrutador, 30 archivos de referencia, revisión adversarial, curvas de retención, análisis de funnel, descomposición de tasas, Gotchas, colocalización skill-modelo, hook de revisión de código, 90% de las PR con una skill, validación, evaluaciones offline, snapshot de ground truth, pruebas de ablación, resultado negativo del grep en bruto, pies de página de procedencia, niveles de fuente, recolección de correcciones, agentes programados, definiciones propiedad de los humanos, documentación generada, 21% sin skills, 95% de precisión, 99%, 80% de información presente, punto de partida mínimo, gobernanza de datos, Anthropic Data Science

## Authors

**Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog), catégorie *Enterprise AI*, ~5 min de lecture.

## Ton

**Perfil**: informe técnico interno (*engineering blog post*), registro **técnico-pedagógico y empírico**, de alto nivel (data engineering, semantic layer, evaluaciones, ablaciones), dirigido a **equipos de datos/analítica y de plataforma**. Postura: *"esto es lo que nos funcionó y lo que no nos funcionó"*, respaldada por **cifras** y **resultados negativos** asumidos.

**Estilo**: Estructurado en **capas** (una pila de 4 niveles) con un hilo conductor claro (reducir la ambigüedad → hacer descubrible → señalar la obsolescencia). Honestidad científica: las **ablaciones** y los **resultados negativos** se ponen en primer plano (grep en bruto <1%, definiciones del LLM netamente negativas), lo que da credibilidad a la pieza. Denso en **métricas** precisas (21%, 95%, 99%, +6%/+32%/+72%, 80%, 90%). Vocabulario de gobernanza de datos (canonical, lineage, ownership, tiering).

**Aforismos clave**:
- ***"Para los casos de uso de analítica, a menudo solo hay una única respuesta correcta usando una única fuente correcta."***
- ***"Sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95% en conjunto."***
- ***"Los agentes están estructuralmente obligados (por instrucción de la skill) a recurrir primero a la semantic layer."***
- ***"Tratar los metadatos como un producto de primera clase."***
- ***"Aproximadamente el 90% de nuestras PR de modelo de datos ahora incluyen un cambio de skill en el mismo diff."***
- (fallo silencioso) *"La respuesta es incorrecta, pero parece plausible y se usa sin objeción."*

**Metáforas / marcos desarrollados**:
- ***Única respuesta correcta*** — analítica ≠ código: lo que se valora no es la creatividad del modelo sino la **precisión determinista**; la infraestructura tiene prioridad sobre la capa generativa.
- ***Pila de analítica agéntica (4 capas)*** — fundamentos → fuentes de verdad → skills → validación.
- ***Skills en pares*** — *Knowledge* (enrutador/búsqueda) + *Unbook* (flujo de trabajo del analista senior).
- ***Documentación generada, definiciones propiedad de los humanos*** — el LLM redacta, el humano **decide** las definiciones.
- ***Pies de página de procedencia*** — trazabilidad de la respuesta (nivel de fuente / frescura / propiedad) como salvaguarda anti-obsolescencia.
- ***El cuello de botella es la estructura, no el acceso*** — la ablación de grep en bruto demuestra que más acceso ≠ más precisión.

**Postura epistémica**: un informe **empírico y medido**, con evaluaciones y ablaciones reproducibles — una de las publicaciones más rigurosas de Anthropic sobre **context engineering** aplicada a los datos. Se lee como un **plano de arquitectura** de producción para agentes de analítica, transferible fuera de Anthropic.

**Autoridad**: (a) **el propio productor del modelo** (Anthropic) aplicando Claude a sus propios datos de back-office; (b) **cifras y ablaciones** (incluidos resultados negativos); (c) **arquitectura en capas** directamente accionable; (d) coherencia con la doctrina de *skills / systems around the model* presente en el resto del ecosistema.

## Pense-betes

- **Fecha / fuente**: **3 de junio de 2026**, blog de Anthropic (*claude.com/blog*, Enterprise AI). Autores: el equipo de **Data Science & Data Engineering** de Anthropic (Chang, Peng, Leder, Jiao, Cherry).
- **Resultado principal**: **95% de las consultas de analítica de negocio automatizadas**, **~95% de precisión** en conjunto (hasta **~99%** en ciertos dominios).
- **Tesis**: analítica ≠ código — *"solo hay una única respuesta correcta usando una única fuente correcta"* → el reto es **asociar la pregunta con las entidades correctas y actuales**, no generar. ### 3 modos de fallo 1. **Ambigüedad concepto↔entidad** — cientos de opciones; p. ej. *"usuarios activos"* (¿qué acciones? ¿se excluye a los fraudulentos? ¿qué ventana de retrospección?). 2. **Obsolescencia (staleness)** — los activos y el conocimiento del agente se vuelven *"sutilmente incorrectos"* (los esquemas/definiciones cambian continuamente). 3. **Fallo de recuperación** — el **80%** de las consultas fallidas tenían la información **presente** en el corpus de todos modos.
- Peligro último = **fallo silencioso**: *"la respuesta es incorrecta, pero parece plausible y se usa sin objeción"*. ### Pila agéntica de 4 capas
- **L1 — Fundamentos de datos**: modelado dimensional, **conjuntos de datos canónicos** (fuente única de verdad, con propietario, listos para consumo), metadatos como *"producto de primera clase"*, integridad entre capas vía CI/CD.
- **L2 — Fuentes de verdad** (confianza ↓): **semantic layer** (obligatoria en primer lugar) → **grafo de linaje/transformación** → **corpus de consultas** (destilado en documentos, no recuperación en bruto) → **contexto de negocio** (grafo de conocimiento: hojas de ruta, registros de decisiones, organización).
- **L3 — Skills** (la palanca): **21% → 95%+**. Pares: **Knowledge skill** (enrutador → ~**30** archivos de referencia) + **Unbook skill** (flujo de trabajo del analista senior: aclarar → fuentes → ejecutar → **revisión adversarial**; patrones reutilizables: curvas de retención, descomposición de tasas, funnel). Esqueleto de documento típico: Referencia rápida / Dimensiones y tablas clave / **Gotchas** / Buenas prácticas y patrones de consulta / Referencias entre dominios.
- **L4 — Validación**: evaluaciones offline (umbral **~90%** para autorizar un agente, objetivo ~100%, ground truth fijado sobre un snapshot, *"almacenar los resultados como telemetría"*), **pruebas de ablación**, online (revisión adversarial, pies de página de procedencia, controles de calidad de datos, **recolección de correcciones** por agentes programados). ### Resultados destacados (cifras y ablaciones)
- **Sin skills ≤ 21%**; **con skills > 95%** (≈99% en ciertos dominios).
- **Revisión adversarial**: **+6%** de precisión, pero **+32%** de tokens y **+72%** de latencia (una contrapartida que hay que aceptar).
- **Ablación de grep en bruto** (miles de archivos SQL accesibles): la precisión se mueve ***"menos de un punto"*** → **el cuello de botella es la estructura, no el acceso**.
- **Definiciones generadas por el LLM** = *"netamente negativo"* (codifican precisamente las ambigüedades que se pretendía eliminar) → **definiciones propiedad de los humanos**.
- **Recuperación no estructurada** sobre miles de consultas: ganancia **< 1 punto** → el corpus debe ser **destilado**, no buscado en bruto.
- **Mantenimiento**: hook de revisión de código → **~90% de las PR de datos** tocan un archivo de skill en el mismo diff. ### Para usar en misiones / presentaciones
- **Plano de agente de analítica en producción** transferible a otros contextos: gobernanza de datos + semantic layer **obligatoria** + skills + evaluaciones con umbral.
- **Punto de partida mínimo** (reutilizable tal cual): *"un puñado de conjuntos de datos canónicos, unas pocas docenas de evaluaciones offline y una thin knowledge skill"* capturan *"la mayor parte del beneficio"*.
- **Argumentos anti-RAG-ingenuo**: los dos resultados negativos (grep en bruto, recuperación no estructurada) son munición contra *"simplemente darle todo al agente"*.
- **Métrica de gobernanza viva**: *"el 90% de las PR incluyen una skill"* = prueba de que la documentación y el código evolucionan juntos (anti-obsolescencia).
- Conecta con: skills (Shihipar/Anthropic), semantic layer/ontología (Talisman, Seale), context engineering (Debois/Tessl), *systems around the model* (Dropbox), datos de grafo de conocimiento (Netflix UDA).

## RésuméDe400mots

Publicado el **3 de junio de 2026** en el blog de Anthropic, este informe del equipo de **Data Science & Data Engineering** (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) describe cómo Anthropic hizo que su analítica fuera **self-service** con Claude: **95% de las consultas de negocio automatizadas**, **~95% de precisión** en conjunto (hasta ~99% en ciertos dominios).

El punto de partida es que la analítica **no** es código: *"a menudo solo hay una única respuesta correcta usando una única fuente correcta"*. El reto no es la creatividad generativa sino la capacidad de **asociar una pregunta con entidades precisas y actualizadas** en el modelo de datos. Tres modos de fallo amenazan esto: **ambigüedad concepto↔entidad** (¿qué cuenta como *"usuarios activos"*? ¿se excluye a los fraudulentos? ¿qué ventana?), **obsolescencia (staleness)** de los activos y del conocimiento del agente, y **fallo de recuperación** — el **80%** de las consultas fallidas tenían igualmente la información presente en el corpus. El peor caso es el **fallo silencioso**: una respuesta incorrecta pero plausible, usada sin objeción.

La respuesta es una *"pila de analítica agéntica"* de **cuatro capas**. (1) **Fundamentos de datos**: modelado dimensional, **conjuntos de datos canónicos** *"fuente única de verdad"*, metadatos tratados *"como producto de primera clase"*, integridad vía CI/CD. (2) **Fuentes de verdad** en orden decreciente de confianza: una **semantic layer** que el agente está *"estructuralmente obligado (por instrucción de la skill) a recurrir primero"*, después el **linaje**, un **corpus de consultas** destilado en documentos (no recuperación en bruto), y un **grafo de conocimiento de negocio** (hojas de ruta, registros de decisiones, organización). (3) **Skills** — la palanca decisiva: *"sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%"*. Se organizan **en pares**: una *Knowledge skill* enrutadora (~30 archivos de referencia) y una *Unbook skill* que codifica el flujo de trabajo del analista senior (aclarar, buscar fuentes, ejecutar, **revisión adversarial**). El mantenimiento está **colocalizado**: un hook de revisión señala cualquier cambio de modelo sin el cambio de skill correspondiente — **~90% de las PR de datos** ahora incluyen una skill en el mismo diff. (4) **Validación**: evaluaciones offline con umbral (~90% para autorizar un agente), **pruebas de ablación**, y salvaguardas online (revisión adversarial: **+6%** de precisión pero **+32%** de tokens y **+72%** de latencia; *pies de página de procedencia*; **recolección de correcciones** por agentes programados).

Dos resultados negativos dan forma a la doctrina: dar acceso mediante **grep en bruto** a miles de archivos SQL mueve la precisión *"menos de un punto"* (el cuello de botella es la **estructura**, no el acceso), y dejar que el LLM **defina** las métricas fue *"netamente negativo"* — de ahí la regla: documentación generada, definiciones propiedad de los humanos. Para empezar: un puñado de conjuntos de datos canónicos, unas pocas docenas de evaluaciones, una thin knowledge skill.

## GrapheDeConnaissance

- équipe Data Science & Data Engineering Anthropic —publie→ How Anthropic enables self-service data analytics with Claude (DOCUMENT, 0.97)
- Anthropic —mesure→ 95% des requêtes analytics métier automatisées via Claude (MESURE, 0.95)
- analytics agentique —est_basé_sur→ une seule bonne réponse depuis une seule bonne source (CONCEPT, 0.94)
- skills (analytics) —améliore→ la précision de 21% à plus de 95% (CONCEPT, 0.95)
- agent analytics —utilise→ semantic layer (CONCEPT, 0.93)
- équipe Data Science & Data Engineering Anthropic —recommande→ distiller le query corpus en docs structurées (pas de retrieval brut) (METHODOLOGIE, 0.9)
- retrieval non structuré —améliore→ la précision de moins d'un point (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ accès grep brut au SQL : précision quasi inchangée (goulot = structure, pas accès) (MESURE, 0.92)
- revue adversariale —améliore→ la précision de 6% (mais +32% tokens, +72% latence) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —affirme_que→ les définitions de métriques générées par LLM sont net-negative sur les evals (AFFIRMATION, 0.88)
- équipe Data Science & Data Engineering Anthropic —recommande→ définitions de métriques détenues par des humains (METHODOLOGIE, 0.92)
- hook de code-review —permet→ colocalisation modèle/skill (signale tout changement de modèle sans fichier skill) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ ~90% des PR data incluent un changement de skill dans le même diff (MESURE, 0.9)
- échec silencieux —permet→ une réponse fausse, plausible, utilisée sans objection (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —recommande→ seuil d'eval (~90%) requis avant qu'un domain owner lance un agent (METHODOLOGIE, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03/
