# anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03

## Veille

Approfondimento tecnico del team **Data Science & Data Engineering** di Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) pubblicato il **3 giugno 2026** sul blog Anthropic (categoria *Enterprise AI*, incentrato su **Claude Code**). **Risultato principale**: ***"il 95% delle query di business analytics viene automatizzato da Claude, con un'accuratezza aggregata del ~95%"*** (fino al **~99%** in alcuni ambiti). **Problema di fondo**: l'analytics **non** è codice — *"spesso esiste un'unica risposta corretta a partire da un'unica fonte corretta"* — richiede di **mappare la domanda dell'utente su entità precise e aggiornate** nel modello dei dati. Tre **modalità di fallimento**: (1) **ambiguità concetto↔entità** (es. *"utenti attivi"*: quali azioni? escludere i truffatori? quale finestra temporale?); (2) **obsolescenza** (gli asset e la conoscenza dell'agente diventano *"sottilmente errati"*); (3) **fallimento del retrieval** (*"l'80% delle query fallite aveva l'informazione presente nel corpus"* ma introvabile). **Soluzione = uno "stack di analytics agentico" a 4 livelli**: (L1) **Fondamenta dei dati** — modellazione dimensionale, **dataset canonici** *"fonte unica di verità"*, metadati *"come prodotto di prima classe"*, integrità tramite CI/CD; (L2) **Fonti di verità** in ordine decrescente di affidabilità — **semantic layer** (l'agente è *"strutturalmente obbligato (per istruzione della skill) a utilizzare prima il semantic layer"*), grafo di lineage, **corpus di query** (distillato in documenti strutturati, **non** retrieval grezzo), contesto di business (grafo di conoscenza: roadmap, decision log, organizzazione); (L3) **Skills** — la leva decisiva: ***"senza skill … non si superava il 21% … Aggiungendo le skill questi numeri salgono stabilmente oltre il 95%"***; strutturate **in coppie** (*Knowledge skill* = router verso ~30 file di riferimento; *Unbook skill* = workflow da analista senior: chiarire → trovare le fonti → eseguire → **revisione avversariale**); manutenzione **colocata** (*"un hook di code review segnala qualsiasi modifica al modello di reporting che non tocchi un file di skill"* → **~90% delle PR sui dati include una modifica a una skill**); (L4) **Validazione** — eval offline (soglia ~90% per lanciare un agente, obiettivo ~100%), **ablation testing** (risultato negativo notevole: grep grezzo su migliaia di file SQL → l'accuratezza si muove *"meno di un punto"*), online (revisione avversariale: **+6% accuratezza, +32% token, +72% latenza**), **footer di provenienza** (livello della fonte + freschezza + proprietà), **raccolta attiva di correzioni** (agenti pianificati che scansionano i canali per redigere correzioni in markdown). **Intuizione strategica**: *"documentazione generata, definizioni possedute dagli esseri umani"* — lasciare che l'LLM **definisca** le metriche si è rivelato *"netamente negativo"*. **Punto di partenza minimo**: una manciata di dataset canonici + qualche decina di eval + una *knowledge skill leggera* catturano *"la maggior parte del vantaggio"*. Converge fortemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = cartelle, Gotchas, hook), la dottrina dei *sistemi attorno al modello* di [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], il **semantic layer / ontologia** di talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 e seale-semantic-agent-model-harness-ontology-data-2026-04-17, il *context development lifecycle* di debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, e l'UDA/knowledge graph di netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

## Titre Article

How Anthropic enables self-service data analytics with Claude

## Date

2026-06-03

## URL

https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude

## Keywords

self-service analytics, agentic data analytics, Claude Code, single correct answer, question-to-entity mapping, data model, failure modes, concept-entity ambiguity, active users, asset staleness, data staleness, retrieval failure, agentic analytics stack, data foundations, dimensional modeling, canonical datasets, single source of truth, metadata as first-class product, lineage, semantic layer, structurally required, query corpus, business knowledge graph, decision logs, skills, knowledge skill, unbook skill, router, 30 reference files, adversarial review, retention curves, funnel analysis, rate decomposition, Gotchas, skill-model colocation, code-review hook, 90% of PRs with a skill, validation, offline evals, ground truth snapshot, ablation testing, raw grep negative result, provenance footers, source tiers, correction harvesting, scheduled agents, definitions owned by humans, documentation generated, 21% without skills, 95% accuracy, 99%, 80% info present, minimal starting point, data governance, Anthropic Data Science

## Authors

**Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog), catégorie *Enterprise AI*, ~5 min de lecture.

## Ton

**Profilo**: approfondimento ingegneristico interno (*engineering blog post*), registro **tecnico-pedagogico ed empirico**, alto livello (data engineering, semantic layer, eval, ablation), rivolto ai **team data/analytics e platform**. Postura: *"ecco cosa ha funzionato e cosa non ha funzionato per noi"*, supportata da **numeri** e **risultati negativi** assunti apertamente.

**Stile**: Strutturato in **livelli** (uno stack a 4 strati) con un filo conduttore chiaro (ridurre l'ambiguità → rendere reperibile → segnalare l'obsolescenza). Onestà scientifica: le **ablation** e i **risultati negativi** sono messi in primo piano (grep grezzo <1%, definizioni LLM netamente negative), il che conferisce credibilità al testo. Denso di **metriche** precise (21%, 95%, 99%, +6%/+32%/+72%, 80%, 90%). Vocabolario di data governance (canonico, lineage, ownership, tiering).

**Aforismi chiave**:
- ***"For analytics use cases, there's often only a single correct answer using a single correct source."***
- ***"Without skills … didn't exceed 21% … Adding skills gets these numbers consistently above 95% in aggregate."***
- ***"Agents are structurally required (by skill instruction) to leverage the semantic layer first."***
- ***"Treat metadata as a first-class product."***
- ***"Roughly 90% of our data-model PRs now include a skill change in the same diff."***
- (fallimento silenzioso) *"The answer is wrong, but looks plausible and is used without objection."*

**Metafore / framework sviluppati**:
- ***Single correct answer*** — analytics ≠ codice: non è la creatività del modello a essere valorizzata ma l'**accuratezza deterministica**; l'infrastruttura ha priorità sul livello generativo.
- ***Agentic analytics stack (4 livelli)*** — fondamenta → fonti di verità → skills → validazione.
- ***Skills in coppie*** — *Knowledge* (router/ricerca) + *Unbook* (workflow da analista senior).
- ***Documentazione generata, definizioni possedute dagli esseri umani*** — l'LLM redige, l'essere umano **decide** le definizioni.
- ***Footer di provenienza*** — tracciabilità della risposta (livello della fonte / freschezza / ownership) come guardrail anti-obsolescenza.
- ***Il collo di bottiglia è la struttura, non l'accesso*** — l'ablation con grep grezzo dimostra che più accesso non significa più accuratezza.

**Postura epistemica**: un approfondimento **empirico e misurato**, con eval e ablation riproducibili — uno dei post più rigorosi di Anthropic sul **context engineering** applicato ai dati. Si legge come un **blueprint architetturale** di produzione per agenti analytics, trasferibile al di fuori di Anthropic.

**Autorevolezza**: (a) **lo stesso produttore del modello** (Anthropic) che applica Claude ai propri dati di back-office; (b) **numeri e ablation** (inclusi i risultati negativi); (c) **architettura a livelli** direttamente attuabile; (d) coerenza con la dottrina *skills / sistemi attorno al modello* riscontrabile nel resto dell'ecosistema.

## Pense-betes

- **Data / fonte**: **3 giugno 2026**, blog Anthropic (*claude.com/blog*, Enterprise AI). Autori: il team **Data Science & Data Engineering** di Anthropic (Chang, Peng, Leder, Jiao, Cherry).
- **Risultato principale**: **95% delle query di business analytics automatizzate**, **~95% di accuratezza** in aggregato (fino al **~99%** in alcuni ambiti).
- **Tesi**: analytics ≠ codice — *"un'unica risposta corretta a partire da un'unica fonte corretta"* → la difficoltà è **mappare la domanda sulle entità giuste e aggiornate**, non generare. ### 3 modalità di fallimento 1. **Ambiguità concetto↔entità** — centinaia di opzioni; es. *"utenti attivi"* (quali azioni? escludere i truffatori? quale finestra di lookback?). 2. **Obsolescenza (staleness)** — gli asset e la conoscenza dell'agente diventano *"sottilmente errati"* (schemi/definizioni cambiano continuamente). 3. **Fallimento del retrieval** — l'**80%** delle query fallite aveva comunque l'informazione **presente** nel corpus.
- Pericolo ultimo = **fallimento silenzioso**: *"la risposta è sbagliata, ma sembra plausibile e viene usata senza obiezioni"*. ### Stack agentico a 4 livelli
- **L1 — Fondamenta dei dati**: modellazione dimensionale, **dataset canonici** (fonte unica di verità, con proprietario, pronti al consumo), metadati come *"prodotto di prima classe"*, integrità cross-layer tramite CI/CD.
- **L2 — Fonti di verità** (affidabilità ↓): **semantic layer** (obbligatorio per primo) → **grafo di lineage/trasformazione** → **corpus di query** (distillato in documenti, non retrieval grezzo) → **contesto di business** (grafo di conoscenza: roadmap, decision log, organizzazione).
- **L3 — Skills** (la leva): **21% → 95%+**. Coppie: **Knowledge skill** (router → ~**30** file di riferimento) + **Unbook skill** (workflow da analista senior: chiarire → fonti → eseguire → **revisione avversariale**; pattern riutilizzabili: curve di retention, scomposizione dei tassi, funnel). Scheletro tipico della doc: Quick reference / Dimensioni & tabelle chiave / **Gotchas** / Best practice & pattern di query / Riferimenti cross-domain.
- **L4 — Validazione**: eval offline (soglia **~90%** per autorizzare un agente, obiettivo ~100%, ground truth fissato su uno snapshot, *"conservare i risultati come telemetria"*), **ablation testing**, online (revisione avversariale, footer di provenienza, controlli di qualità dei dati, **raccolta di correzioni** da agenti pianificati). ### Risultati notevoli (numeri e ablation)
- **Senza skill ≤ 21%**; **con skill > 95%** (≈99% in alcuni ambiti).
- **Revisione avversariale**: **+6%** di accuratezza, ma **+32%** di token e **+72%** di latenza (un compromesso da accettare).
- **Ablation con grep grezzo** (migliaia di file SQL accessibili): l'accuratezza si muove ***"meno di un punto"*** → **il collo di bottiglia è la struttura, non l'accesso**.
- **Definizioni generate dall'LLM** = *"netamente negativo"* (codificano proprio le ambiguità che si voleva eliminare) → **definizioni possedute dagli esseri umani**.
- **Retrieval non strutturato** su migliaia di query: guadagno **< 1 punto** → il corpus va **distillato**, non cercato grezzo.
- **Manutenzione**: hook di code review → **~90% delle PR sui dati** tocca un file di skill nello stesso diff. ### Da usare in engagement / presentazioni
- **Blueprint di agente analytics in produzione** trasferibile altrove: governance dei dati + semantic layer **obbligatorio** + skills + eval a soglia.
- **Punto di partenza minimo** (riutilizzabile così com'è): *"una manciata di dataset canonici, qualche decina di eval offline e una knowledge skill leggera"* catturano *"la maggior parte del vantaggio"*.
- **Argomenti anti-naive-RAG**: i due risultati negativi (grep grezzo, retrieval non strutturato) sono munizioni contro *"basta dare tutto all'agente"*.
- **Metrica di governance vivente**: *"il 90% delle PR include una skill"* = prova che doc e codice evolvono insieme (anti-obsolescenza).
- Si collega a: skills (Shihipar/Anthropic), semantic layer/ontologia (Talisman, Seale), context engineering (Debois/Tessl), *sistemi attorno al modello* (Dropbox), knowledge graph dei dati (Netflix UDA).

## RésuméDe400mots

Pubblicato il **3 giugno 2026** sul blog Anthropic, questo approfondimento del team **Data Science & Data Engineering** (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) descrive come Anthropic ha reso il proprio analytics **self-service** con Claude: **95% delle query di business automatizzate**, **~95% di accuratezza** in aggregato (fino al ~99% in alcuni ambiti).

Il punto di partenza è che l'analytics **non** è codice: *"spesso esiste un'unica risposta corretta a partire da un'unica fonte corretta"*. La difficoltà non risiede nella creatività generativa ma nella capacità di **mappare una domanda su entità precise e aggiornate** nel modello dei dati. Tre modalità di fallimento minacciano questo processo: **ambiguità concetto↔entità** (cosa conta come *"utenti attivi"*? i truffatori vengono esclusi? quale finestra temporale?), **obsolescenza** degli asset e della conoscenza dell'agente, e **fallimento del retrieval** — l'**80%** delle query fallite aveva comunque l'informazione presente nel corpus. Il caso peggiore è il **fallimento silenzioso**: una risposta sbagliata ma plausibile, usata senza obiezioni.

La risposta è uno *"stack di analytics agentico"* a **quattro livelli**. (1) **Fondamenta dei dati**: modellazione dimensionale, **dataset canonici** *"fonte unica di verità"*, metadati trattati *"come prodotto di prima classe"*, integrità tramite CI/CD. (2) **Fonti di verità** in ordine decrescente di affidabilità: un **semantic layer** che l'agente è *"strutturalmente obbligato (per istruzione della skill) a utilizzare per primo"*, poi il **lineage**, un **corpus di query** distillato in documenti (non retrieval grezzo), e un **grafo di conoscenza di business** (roadmap, decision log, organizzazione). (3) **Skills** — la leva decisiva: *"senza skill … non si superava il 21% … Aggiungendo le skill questi numeri salgono stabilmente oltre il 95%"*. Sono organizzate **in coppie**: una *Knowledge skill* router (~30 file di riferimento) e una *Unbook skill* che codifica il workflow dell'analista senior (chiarire, trovare le fonti, eseguire, **revisione avversariale**). La manutenzione è **colocata**: un hook di revisione segnala qualsiasi modifica al modello senza una corrispondente modifica alla skill — **~90% delle PR sui dati** ora include una skill nello stesso diff. (4) **Validazione**: eval offline basate su soglia (~90% per autorizzare un agente), **ablation testing**, e guardrail online (revisione avversariale **+6%** di accuratezza ma **+32%** di token e **+72%** di latenza; *footer di provenienza*; **raccolta di correzioni** da parte di agenti pianificati).

Due risultati negativi plasmano la dottrina: dare accesso a **grep grezzo** su migliaia di file SQL sposta l'accuratezza *"meno di un punto"* (il collo di bottiglia è la **struttura**, non l'accesso), e lasciare che l'LLM **definisca** le metriche si è rivelato *"netamente negativo"* — da qui la regola: documentazione generata, definizioni possedute dagli esseri umani. Per iniziare: una manciata di dataset canonici, qualche decina di eval, una knowledge skill leggera.

## GrapheDeConnaissance

- équipe Data Science & Data Engineering Anthropic —publie→ How Anthropic enables self-service data analytics with Claude (DOCUMENT, 0.97)
- Anthropic —mesure→ 95% des requêtes analytics métier automatisées via Claude (MESURE, 0.95)
- analytics agentique —est_basé_sur→ une seule bonne réponse depuis une seule bonne source (CONCEPT, 0.94)
- skills (analytics) —améliore→ la précision de 21% à plus de 95% (CONCEPT, 0.95)
- agent analytics —utilise→ semantic layer (CONCEPT, 0.93)
- équipe Data Science & Data Engineering Anthropic —recommande→ distiller le query corpus en docs structurées (pas de retrieval brut) (METHODOLOGIE, 0.9)
- retrieval non structuré —améliore→ la précision de moins d'un point (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ accès grep brut au SQL : précision quasi inchangée (goulot = structure, pas accès) (MESURE, 0.92)
- revue adversariale —améliore→ la précision de 6% (mais +32% tokens, +72% latence) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —affirme_que→ les définitions de métriques générées par LLM sont net-negative sur les evals (AFFIRMATION, 0.88)
- équipe Data Science & Data Engineering Anthropic —recommande→ définitions de métriques détenues par des humains (METHODOLOGIE, 0.92)
- hook de code-review —permet→ colocalisation modèle/skill (signale tout changement de modèle sans fichier skill) (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —mesure→ ~90% des PR data incluent un changement de skill dans le même diff (MESURE, 0.9)
- échec silencieux —permet→ une réponse fausse, plausible, utilisée sans objection (CONCEPT, 0.9)
- équipe Data Science & Data Engineering Anthropic —recommande→ seuil d'eval (~90%) requis avant qu'un domain owner lance un agent (METHODOLOGIE, 0.88)

---
Canonical: https://www.thekb.eu/it/fiches/anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03/
