Saltar al contenido

root / tags / gotchas

#gotchas

2 fiches

Agentes de codificación IA y Skills Traducción verificada automáticamente

How Anthropic enables self-service data analytics with Claude

Informe técnico (engineering write-up) del equipo de **Data Science & Data Engineering** de Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), publicado el **3 de junio de 2026** en el blog de Anthropic (categoría *Enterprise AI*, centrado en **Claude Code**). **Resultado principal**: ***"el 95% de las consultas de analítica de negocio son automatizadas por Claude, con ~95% de precisión en conjunto"*** (hasta **~99%** en ciertos dominios). **Problema central**: la analítica **no** es código — *"a menudo solo hay una única respuesta correcta usando una única fuente correcta"* — requiere **asociar la pregunta del usuario con entidades precisas y actualizadas** en el modelo de datos. Tres **modos de fallo**: (1) **ambigüedad concepto↔entidad** (p. ej. *"usuarios activos"*: ¿qué acciones? ¿se excluye a los fraudulentos? ¿qué ventana temporal?); (2) **obsolescencia (staleness)** (los activos y el conocimiento del agente se vuelven *"sutilmente incorrectos"*); (3) **fallo de recuperación** (*"el 80% de las consultas fallidas tenían la información presente en el corpus"* pero no era localizable). **Solución = una "pila de analítica agéntica" de 4 capas**: (L1) **Fundamentos de datos** — modelado dimensional, **conjuntos de datos canónicos** *"fuente única de verdad"*, metadatos *"como producto de primera clase"*, integridad vía CI/CD; (L2) **Fuentes de verdad** en orden decreciente de confianza — **semantic layer** (el agente está *"estructuralmente obligado (por instrucción de la skill) a recurrir primero a la semantic layer"*), grafo de linaje, **corpus de consultas** (destilado en documentos estructurados, **no** recuperación en bruto), contexto de negocio (grafo de conocimiento: hojas de ruta, registros de decisiones, organización); (L3) **Skills** — la palanca decisiva: ***"sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%"***; estructuradas **en pares** (*Knowledge skill* = enrutador hacia ~30 archivos de referencia; *Unbook skill* = flujo de trabajo de analista senior: aclarar → buscar fuentes → ejecutar → **revisión adversarial**); mantenimiento **colocalizado** (*"un hook de revisión de código señala cualquier cambio del modelo de reporting que no toque un archivo de skill"* → **~90% de las PR de datos incluyen un cambio de skill**); (L4) **Validación** — evaluaciones offline (umbral ~90% para lanzar un agente, objetivo ~100%), **pruebas de ablación** (resultado negativo notable: grep en bruto sobre miles de archivos SQL → la precisión se mueve *"menos de un punto"*), online (revisión adversarial: **+6% de precisión, +32% de tokens, +72% de latencia**), **pies de página de procedencia** (nivel de fuente + frescura + propiedad), **recolección activa de correcciones** (agentes programados que escanean canales para redactar correcciones en markdown). **Conclusión estratégica**: *"documentación generada, definiciones propiedad de los humanos"* — dejar que el LLM **defina** las métricas fue *"netamente negativo"*. **Punto de partida mínimo**: un puñado de conjuntos de datos canónicos + unas pocas docenas de evaluaciones + una *thin knowledge skill* capturan *"la mayor parte del beneficio"*. Converge fuertemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = carpetas, Gotchas, hooks), la doctrina de *systems around the model* de [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], la **semantic layer / ontología** de talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 y seale-semantic-agent-model-harness-ontology-data-2026-04-17, el *context development lifecycle* de debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, y la UDA/grafo de conocimiento de netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

#analítica self-service#analítica de datos agéntica#Claude Code

**Chen Chang · Clement Peng · Justin Leder · Johanne Jiao · Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog) · catégorie *Enterprise AI* · ~5 min de lecture.

Agentes de codificación IA y Skills Traducción verificada automáticamente

Lessons from building Claude Code: How we use skills

Entrada de blog de **Anthropic / claude.com** por **Thariq Shihipar** (Member of Technical Staff, equipo Claude Code), publicada el **3 de junio de 2026**, que destila la **experiencia interna** de Anthropic sobre el diseño y uso de las **Skills**. **Tesis de encuadre**: una Skill no es un simple archivo markdown sino una **carpeta** (instrucciones + scripts + recursos + configuración + hooks) que el agente **descubre y manipula**; *« You should think of the entire file system as a form of context engineering and progressive disclosure. »* El artículo aporta dos contribuciones estructurantes. **(A) Una taxonomía de 9 categorías de skills** observadas en Anthropic: (1) **Library/API Reference** (documentación de libs/CLIs internas con *gotchas* — p. ej. `billing-lib`, `internal-platform-cli`, `sandbox-proxy`); (2) **Product Verification** (pruebas/verificación mediante Playwright o tmux — `signup-flow-driver`, `checkout-verifier`, `tmux-cli-driver`); (3) **Data Fetching & Analysis** (acceso a stacks de datos/monitorización — `funnel-query`, `cohort-compare`, `grafana`, `datadog`); (4) **Business Process Automation** (flujos de trabajo repetitivos — `standup-post`, `weekly-recap`, `create-<ticket>-ticket`); (5) **Code Scaffolding** (boilerplate de frameworks — `new-migration`, `create-app`); (6) **Code Quality & Review** (`adversarial-review`, `code-style`, `testing-practices`); (7) **CI/CD & Deployment** (`babysit-pr`, `deploy-<service>`, `cherry-pick-prod`); (8) **Runbooks** (diagnósticos multi-herramienta — `<service>-debugging`, `oncall-runner`, `log-correlator`); (9) **Infrastructure Operations** (mantenimiento con salvaguardas — `<resource>-orphans`, `cost-investigation`). **(B) Un conjunto de buenas prácticas**: no repetir lo obvio (*« Claude already knows how to code and can read your codebase »* → apuntar a lo que **contradice el comportamiento por defecto**); pulir la **sección Gotchas** (*« the highest-signal content in any skill »*); **divulgación progresiva** a través del árbol de archivos (dirigir hacia archivos de referencia según la situación en lugar de cargar todo por adelantado); **descripciones escritas para el modelo** (*« the description field is not a summary, it's a description of when to trigger this skill »*); **flujos de configuración** (config en `config.json`, o en su defecto preguntar vía `AskUserQuestion`); **memoria persistente** (logs append-only / JSON mediante la variable `${CLAUDE_PLUGIN_DATA}`); **scripts auxiliares** (*« lets Claude spend its turns on composition… rather than reconstructing boilerplate »*); **hooks conditionnels** (habilitados solo durante la skill — p. ej. un hook de seguridad que bloquea comandos destructivos). **Distribución en Anthropic**: las skills se almacenan en `./.claude/skills`, se comparten de forma informal vía Slack en una carpeta sandbox, y luego se promueven mediante **PR** al **marketplace** interno una vez que ganan tracción; **medición de uso** mediante un **hook PreToolUse** que registra las invocaciones (revelando las skills populares frente a las infrautilizadas). Continuación directa de la fiche [[shihipar-claude-code-html-unreasonable-effectiveness-markdown-2026-05-10]] (mismo autor) y complemento concreto a las fiches sobre Skills de Anthropic/Willison/Vincent y al *harness engineering*.

#skills#Claude Code#Anthropic

**Thariq Shihipar** (Member of Technical Staff chez Anthropic, équipe **Claude Code** ; @trq212 / @trq sur X, thariqs.github.io) · pour le blog **claude.com**. Même auteur que la fiche *Using Claude Code: The Unreasonable Effectiveness of HTML* (2026-05-10). Publié le **3 juin 2026**.