# anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03

## Veille

Fachbeitrag des Teams **Data Science & Data Engineering** von Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), veröffentlicht am **3. Juni 2026** im Anthropic-Blog (Kategorie *Enterprise AI*, Schwerpunkt **Claude Code**). **Kernergebnis**: ***"95% of business analytics queries are automated by Claude, with ~95% accuracy in aggregate"*** (bis zu **~99%** in bestimmten Domänen). **Kernproblem**: Analytics ist **kein** Code — *"there's often only a single correct answer using a single correct source"* — es erfordert, **eine Nutzerfrage auf präzise, aktuelle Entitäten** im Datenmodell abzubilden. Drei **Fehlermodi**: (1) **Ambiguität zwischen Konzept und Entität** (z. B. *"active users"*: welche Aktionen? Betrüger ausschließen? welches Zeitfenster?); (2) **Veralterung (Staleness)** (Assets und das Wissen des Agenten werden *"subtly wrong"*); (3) **Retrieval-Fehler** (*"80% of failed queries had the information present in the corpus"*, aber nicht auffindbar). **Lösung = ein 4-schichtiger "agentic analytics stack"**: (L1) **Data foundations** — dimensionale Modellierung, **kanonische Datensätze** *"single source-of-truth"*, Metadaten *"as a first-class product"*, Integrität via CI/CD; (L2) **Sources of truth** in absteigender Vertrauensreihenfolge — **semantic layer** (der Agent ist *"structurally required (by skill instruction) to leverage the semantic layer first"*), Lineage-Graph, **Query-Korpus** (destilliert in strukturierte Dokumente, **nicht** rohes Retrieval), Geschäftskontext (Knowledge Graph: Roadmaps, Entscheidungsprotokolle, Organisation); (L3) **Skills** — der entscheidende Hebel: ***"without skills … didn't exceed 21% … Adding skills gets these numbers consistently above 95%"***; strukturiert **in Paaren** (*Knowledge skill* = Router zu ~30 Referenzdateien; *Unbook skill* = Workflow eines Senior-Analysten: klären → Quellen finden → ausführen → **adversarial review**); Wartung **kolokiert** (*"a code-review hook flags any reporting-model change that doesn't touch a skill file"* → **~90% der Daten-PRs enthalten eine Skill-Änderung**); (L4) **Validation** — Offline-Evals (Schwellenwert ~90% zur Freigabe eines Agenten, Ziel ~100%), **Ablation-Testing** (bemerkenswertes negatives Ergebnis: rohes Grep über tausende SQL-Dateien → Genauigkeit bewegt sich *"less than a point"*), Online (Adversarial Review: **+6% Genauigkeit, +32% Tokens, +72% Latenz**), **Provenance-Footer** (Quellenstufe + Aktualität + Ownership), **aktives Correction Harvesting** (geplante Agenten durchsuchen Kanäle, um Markdown-Korrekturen zu entwerfen). **Strategische Erkenntnis**: *"documentation generated, definitions owned by humans"* — dem LLM zu überlassen, Metriken zu **definieren**, war *"net-negative"*. **Minimaler Startpunkt**: eine Handvoll kanonischer Datensätze + einige Dutzend Evals + ein *thin knowledge skill* erfassen *"most of the upside"*. Starke Konvergenz mit [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (Skills = Ordner, Gotchas, Hooks), der Doktrin *systems around the model* von [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], dem **semantic layer / Ontologie**-Ansatz von talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 und seale-semantic-agent-model-harness-ontology-data-2026-04-17, dem *context development lifecycle* von debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19 sowie der UDA/Knowledge-Graph von netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

## Titre Article

How Anthropic enables self-service data analytics with Claude

## Date

2026-06-03

## URL

https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude

## Keywords

self-service analytics, agentic data analytics, Claude Code, single correct answer, question-to-entity mapping, data model, failure modes, concept-entity ambiguity, active users, asset staleness, data staleness, retrieval failure, agentic analytics stack, data foundations, dimensional modeling, canonical datasets, single source of truth, metadata as first-class product, lineage, semantic layer, structurally required, query corpus, business knowledge graph, decision logs, skills, knowledge skill, unbook skill, router, 30 reference files, adversarial review, retention curves, funnel analysis, rate decomposition, Gotchas, skill-model colocation, code-review hook, 90% of PRs with a skill, validation, offline evals, ground truth snapshot, ablation testing, raw grep negative result, provenance footers, source tiers, correction harvesting, scheduled agents, definitions owned by humans, documentation generated, 21% without skills, 95% accuracy, 99%, 80% info present, minimal starting point, data governance, Anthropic Data Science

## Authors

**Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog), catégorie *Enterprise AI*, ~5 min de lecture.

## Ton

**Profil**: interner Fachbeitrag (*Engineering-Blogpost*), **technisch-pädagogisches und empirisches** Register, hohes Niveau (Data Engineering, semantic layer, Evals, Ablationen), gerichtet an **Data-/Analytics- und Platform-Teams**. Haltung: *"here's what worked and what didn't work for us"*, gestützt auf **Zahlen** und eigene **negative Ergebnisse**.

**Stil**: Strukturiert in **Schichten** (ein 4-stufiger Stack) mit klarem roten Faden (Ambiguität auflösen → auffindbar machen → Veralterung markieren). Wissenschaftliche Ehrlichkeit: **Ablationen** und **negative Ergebnisse** werden in den Vordergrund gestellt (rohes Grep <1%, LLM-Definitionen net-negative), was dem Beitrag Glaubwürdigkeit verleiht. Dicht mit präzisen **Kennzahlen** (21%, 95%, 99%, +6%/+32%/+72%, 80%, 90%). Data-Governance-Vokabular (canonical, lineage, ownership, tiering).

**Zentrale Aphorismen**:
- ***"For analytics use cases, there's often only a single correct answer using a single correct source."***
- ***"Without skills … didn't exceed 21% … Adding skills gets these numbers consistently above 95% in aggregate."***
- ***"Agents are structurally required (by skill instruction) to leverage the semantic layer first."***
- ***"Treat metadata as a first-class product."***
- ***"Roughly 90% of our data-model PRs now include a skill change in the same diff."***
- (stilles Versagen) *"The answer is wrong, but looks plausible and is used without objection."*

**Ausgearbeitete Metaphern / Frames**:
- ***Single correct answer*** — Analytics ≠ Code: Nicht die Kreativität des Modells zählt, sondern **deterministische Genauigkeit**; die Infrastruktur hat Vorrang vor der generativen Schicht.
- ***Agentic analytics stack (4 Schichten)*** — Foundations → Sources of truth → Skills → Validation.
- ***Skills in Paaren*** — *Knowledge* (Router/Suche) + *Unbook* (Workflow des Senior-Analysten).
- ***Documentation generated, definitions owned by humans*** — das LLM entwirft, der Mensch **entscheidet** über die Definitionen.
- ***Provenance-Footer*** — Rückverfolgbarkeit der Antwort (Quellenstufe / Aktualität / Ownership) als Anti-Staleness-Sicherung.
- ***The bottleneck is structure, not access*** — die Rohe-Grep-Ablation belegt, dass mehr Zugriff nicht mehr Genauigkeit bedeutet.

**Epistemische Haltung**: ein **empirischer, gemessener** Beitrag mit reproduzierbaren Evals und Ablationen — einer der methodisch stringentesten Beiträge von Anthropic zu **Context Engineering**, angewandt auf Daten. Liest sich als produktionsreifer **Architektur-Blueprint** für Analytics-Agenten, übertragbar über Anthropic hinaus.

**Autorität**: (a) **der Hersteller des Modells selbst** (Anthropic), der Claude auf seine eigenen Back-Office-Daten anwendet; (b) **Zahlen und Ablationen** (inklusive negativer Ergebnisse); (c) direkt umsetzbare **geschichtete Architektur**; (d) Konsistenz mit der *Skills / systems around the model*-Doktrin, die sich im übrigen Ökosystem wiederfindet.

## Pense-betes

- **Datum / Quelle**: **3. Juni 2026**, Anthropic-Blog (*claude.com/blog*, Enterprise AI). Autoren: das Team **Data Science & Data Engineering** von Anthropic (Chang, Peng, Leder, Jiao, Cherry).
- **Kernergebnis**: **95% der Business-Analytics-Queries automatisiert**, **~95% Genauigkeit** im Aggregat (bis zu **~99%** in bestimmten Domänen).
- **These**: Analytics ≠ Code — *"only a single correct answer using a single correct source"* → die Herausforderung ist, **die Frage auf die richtigen, aktuellen Entitäten abzubilden**, nicht sie zu generieren. ### 3 Fehlermodi 1. **Ambiguität zwischen Konzept und Entität** — hunderte Optionen; z. B. *"active users"* (welche Aktionen? Betrüger ausschließen? welches Lookback-Fenster?). 2. **Veralterung (Staleness)** — Assets und das Wissen des Agenten werden *"subtly wrong"* (Schemas/Definitionen ändern sich fortlaufend). 3. **Retrieval-Fehler** — bei **80%** der fehlgeschlagenen Queries war die Information trotzdem im Korpus **vorhanden**.
- Größte Gefahr = **stilles Versagen (silent failure)**: *"the answer is wrong, but looks plausible and is used without objection"*. ### 4-schichtiger agentic stack
- **L1 — Data foundations**: dimensionale Modellierung, **kanonische Datensätze** (single source-of-truth, ownershipbasiert, konsumfertig), Metadaten als *"first-class product"*, schichtübergreifende Integrität via CI/CD.
- **L2 — Sources of truth** (Vertrauen ↓): **semantic layer** (verbindlich zuerst) → **Lineage-/Transformationsgraph** → **Query-Korpus** (destilliert in Dokumente, nicht rohes Retrieval) → **Geschäftskontext** (Knowledge Graph: Roadmaps, Entscheidungsprotokolle, Organisation).
- **L3 — Skills** (der Hebel): **21% → 95%+**. Paare: **Knowledge skill** (Router → ~**30** Referenzdateien) + **Unbook skill** (Workflow eines Senior-Analysten: klären → Quellen → ausführen → **adversarial review**; wiederverwendbare Muster: Retention-Kurven, Rate-Dekomposition, Funnel). Typisches Dokument-Skelett: Kurzreferenz / Dimensionen & Schlüsseltabellen / **Gotchas** / Best Practices & Query-Muster / domänenübergreifende Referenzen.
- **L4 — Validation**: Offline-Evals (Schwellenwert **~90%** zur Freigabe eines Agenten, Ziel ~100%, Ground Truth fixiert auf einem Snapshot, *"store results like telemetry"*), **Ablation-Testing**, Online (Adversarial Review, Provenance-Footer, Datenqualitätsprüfungen, **Correction Harvesting** durch geplante Agenten). ### Bemerkenswerte Ergebnisse (Zahlen & Ablationen)
- **Ohne Skills ≤ 21%**; **mit Skills > 95%** (≈99% in bestimmten Domänen).
- **Adversarial Review**: **+6%** Genauigkeit, aber **+32%** Tokens und **+72%** Latenz (ein hinzunehmender Trade-off).
- **Rohe-Grep-Ablation** (tausende zugängliche SQL-Dateien): Genauigkeit bewegt sich ***"less than a point"*** → **der Flaschenhals ist die Struktur, nicht der Zugriff**.
- **Vom LLM generierte Definitionen** = *"net-negative"* (sie kodieren genau die Ambiguitäten, die eigentlich beseitigt werden sollen) → **Definitionen im Besitz von Menschen**.
- **Unstrukturiertes Retrieval** über tausende Queries: Gewinn **< 1 Punkt** → der Korpus sollte **destilliert**, nicht roh durchsucht werden.
- **Wartung**: Code-Review-Hook → **~90% der Daten-PRs** berühren eine Skill-Datei im selben Diff. ### Zur Verwendung in Engagements / Präsentationen
- **Blueprint für einen Production-Analytics-Agenten**, der auch andernorts übertragbar ist: Data Governance + **verbindlicher** semantic layer + Skills + schwellenwertbasierte Evals.
- **Minimaler Startpunkt** (direkt wiederverwendbar): *"a handful of canonical datasets, a few dozen offline evals, and a thin knowledge skill"* erfassen *"most of the upside"*.
- **Anti-naive-RAG-Argumente**: Die beiden negativen Ergebnisse (rohes Grep, unstrukturiertes Retrieval) sind Munition gegen *"just give the agent everything"*.
- **Lebendige Governance-Metrik**: *"90% of PRs include a skill"* = Beleg dafür, dass sich Dokumentation und Code gemeinsam weiterentwickeln (Anti-Staleness).
- Verbindet sich mit: Skills (Shihipar/Anthropic), semantic layer/Ontologie (Talisman, Seale), Context Engineering (Debois/Tessl), *systems around the model* (Dropbox), Knowledge-Graph-Daten (Netflix UDA).

## RésuméDe400mots

Veröffentlicht am **3. Juni 2026** im Anthropic-Blog beschreibt dieser Fachbeitrag des Teams **Data Science & Data Engineering** (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), wie Anthropic seine Analytics mit Claude **self-service** gemacht hat: **95% der Business-Queries automatisiert**, **~95% Genauigkeit** im Aggregat (bis zu ~99% in bestimmten Domänen).

Ausgangspunkt ist, dass Analytics **kein** Code ist: *"there's often only a single correct answer using a single correct source"*. Die Herausforderung liegt nicht in generativer Kreativität, sondern in der Fähigkeit, **eine Frage auf präzise, aktuelle Entitäten** im Datenmodell abzubilden. Drei Fehlermodi bedrohen dies: **Ambiguität zwischen Konzept und Entität** (was zählt als *"active users"*? werden Betrüger ausgeschlossen? welches Zeitfenster?), **Veralterung** von Assets und dem Wissen des Agenten, sowie **Retrieval-Fehler** — bei **80%** der fehlgeschlagenen Queries war die Information trotzdem im Korpus vorhanden. Der schlimmste Fall ist das **stille Versagen (silent failure)**: eine falsche, aber plausible Antwort, die ohne Widerspruch verwendet wird.

Die Antwort ist ein **vierschichtiger** *"agentic analytics stack"*. (1) **Data foundations**: dimensionale Modellierung, **kanonische Datensätze** *"single source-of-truth"*, Metadaten behandelt *"as a first-class product"*, Integrität via CI/CD. (2) **Sources of truth** in absteigender Vertrauensreihenfolge: ein **semantic layer**, den der Agent *"structurally required (by skill instruction) to leverage first"* ist, dann **Lineage**, ein **Query-Korpus**, destilliert in Dokumente (nicht rohes Retrieval), und ein **geschäftlicher Knowledge Graph** (Roadmaps, Entscheidungsprotokolle, Organisation). (3) **Skills** — der entscheidende Hebel: *"without skills … didn't exceed 21% … Adding skills gets these numbers consistently above 95%"*. Sie sind **paarweise** organisiert: ein Router-*Knowledge skill* (~30 Referenzdateien) und ein *Unbook skill*, der den Workflow des Senior-Analysten kodiert (klären, Quellen finden, ausführen, **adversarial review**). Die Wartung ist **kolokiert**: ein Review-Hook markiert jede Modelländerung ohne zugehörige Skill-Änderung — **~90% der Daten-PRs** enthalten inzwischen einen Skill im selben Diff. (4) **Validation**: schwellenwertbasierte Offline-Evals (~90% zur Freigabe eines Agenten), **Ablation-Testing** und Online-Sicherungen (Adversarial Review **+6%** Genauigkeit, aber **+32%** Tokens und **+72%** Latenz; *Provenance-Footer*; **Correction Harvesting** durch geplante Agenten).

Zwei negative Ergebnisse prägen die Doktrin: rohen **Grep**-Zugriff auf tausende SQL-Dateien zu gewähren, bewegt die Genauigkeit *"less than a point"* (der Flaschenhals ist die **Struktur**, nicht der Zugriff), und dem LLM zu überlassen, Metriken zu **definieren**, war *"net-negative"* — daher die Regel: Dokumentation generiert, Definitionen im Besitz von Menschen. Für den Einstieg: eine Handvoll kanonischer Datensätze, einige Dutzend Evals, ein schlanker Knowledge Skill.

## GrapheDeConnaissance

- équipe Data Science & Data Engineering Anthropic —publie→ How Anthropic enables self-service data analytics with Claude (DOCUMENT, 0.97)
- Anthropic —mesure→ 95% des requêtes analytics métier automatisées via Claude (MESURE, 0.95)
- analytics agentique —est_basé_sur→ une seule bonne réponse depuis une seule bonne source (CONCEPT, 0.94)
- skills (analytics) —améliore→ la précision de 21% à plus de 95% (CONCEPT, 0.95)
- agent analytics —utilise→ semantic layer (CONCEPT, 0.93)
- équipe Data Science & Data Engineering Anthropic —recommande→ distiller le query corpus en docs structurées (pas de retrieval brut) (METHODOLOGIE, 0.9)
- retrieval non structuré —améliore→ la précision de moins d'un point (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ accès grep brut au SQL : précision quasi inchangée (goulot = structure, pas accès) (MESURE, 0.92)
- revue adversariale —améliore→ la précision de 6% (mais +32% tokens, +72% latence) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —affirme_que→ les définitions de métriques générées par LLM sont net-negative sur les evals (AFFIRMATION, 0.88)
- équipe Data Science & Data Engineering Anthropic —recommande→ définitions de métriques détenues par des humains (METHODOLOGIE, 0.92)
- hook de code-review —permet→ colocalisation modèle/skill (signale tout changement de modèle sans fichier skill) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ ~90% des PR data incluent un changement de skill dans le même diff (MESURE, 0.9)
- échec silencieux —permet→ une réponse fausse, plausible, utilisée sans objection (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —recommande→ seuil d'eval (~90%) requis avant qu'un domain owner lance un agent (METHODOLOGIE, 0.88)

---
Canonical: https://www.thekb.eu/de/fiches/anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03/
