Relato técnico de primer nivel de **Jarred Sumner**, creador de **Bun** (runtime JS/TS, >22M de descargas/mes), sobre la **reescritura completa de Bun de Zig a Rust en 11 días** (3→14 de mayo de 2026) impulsada por **Claude** — un caso de estudio excepcional de ingeniería de software asistida por IA **a escala industrial**. Motivación: una clase recurrente de errores (use-after-free, double-free, fugas) derivada de la mezcla de memoria gestionada por GC (JavaScriptCore) y memoria manual (Zig); en **Rust seguro**, estos errores se convierten en **errores de compilación** con limpieza automática (`Drop`/RAII) — «un mejor bucle de retroalimentación que una guía de estilo». Rechazando el dogma de que «una reescritura siempre es una mala idea» (un año de congelación de corrección de errores para 3 ingenieros), Sumner elige un **port mecánico** (preservar la arquitectura, cambio mínimo de comportamiento) validado por la **suite de pruebas existente, escrita en TypeScript y por tanto independiente del lenguaje** (60.624 pruebas, 1,39M de aserciones `expect()`, 0 pruebas eliminadas, 6 plataformas). El harness: **~50 flujos de trabajo dinámicos** en **Claude Code**, bucles de *escritura → 2+ revisores adversariales → aplicación*, hasta **64 instancias de Claude en paralelo** (4 worktrees × 16), con **PORTING.md** + **LIFETIMES.tsv** generados en preparación. Cifras: **6.502 commits** (pico de 695/h, 58/min, ~1.300 líneas/min), diff final **+1.009.272 líneas**, ~16.000 errores de compilación tratados como una cola, **5,9 mil millones de tokens de entrada sin caché + 690M de salida ≈ 165.000 $**. Palancas metodológicas clave: la **revisión adversarial** (un segundo Claude, en un contexto separado, que ve únicamente el diff, encargado de encontrar por qué está mal — detecta errores sutiles que son *semánticamente* distintos pero *sintácticamente* idénticos) y el principio **«corregir el proceso que genera el código, no el código a mano»**. Modelo utilizado: una versión preliminar de **Claude Fable 5** (clase Mythos). Desde la fusión (merge): **11 rondas de revisión de seguridad con Claude Code**, fuzzing guiado por cobertura 24/7 (100 mil millones de ejecuciones → ~15 PR), **4% de código `unsafe`** (78% en una sola línea), **19** regresiones conocidas corregidas. En producción: Claude Code v2.1.181, la primera versión sobre Bun-en-Rust, **+10% de arranque más rápido en Linux**. Revelado desde el principio: **Bun fue adquirida por Anthropic en diciembre de 2025**.
#Bun#Jarred Sumner#reescritura de Zig a Rust
Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)
Cuarta entrega de la serie ADLC: Williams replantea la revisión de código como una "acusación" adversarial en lugar de una evaluación colaborativa. Encarga a los agentes que refuten ("encontrar qué está mal"), despliega revisores de lente única con contextos nuevos (corrección, seguridad, cumplimiento del contrato, alineación con la especificación, calidad de las pruebas), actúa solo sobre hallazgos verificados (reproducidos mediante una prueba que falla) y repite el ciclo hasta que dos pasadas consecutivas arrojen cero hallazgos. Mide la calibración plantando errores conocidos, al estilo de las pruebas de mutación. Puerta de salida: cero hallazgos abiertos, dos pasadas en seco, pruebas en verde, diff de pruebas vacío.
Informe técnico (engineering write-up) del equipo de **Data Science & Data Engineering** de Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), publicado el **3 de junio de 2026** en el blog de Anthropic (categoría *Enterprise AI*, centrado en **Claude Code**). **Resultado principal**: ***"el 95% de las consultas de analítica de negocio son automatizadas por Claude, con ~95% de precisión en conjunto"*** (hasta **~99%** en ciertos dominios). **Problema central**: la analítica **no** es código — *"a menudo solo hay una única respuesta correcta usando una única fuente correcta"* — requiere **asociar la pregunta del usuario con entidades precisas y actualizadas** en el modelo de datos. Tres **modos de fallo**: (1) **ambigüedad concepto↔entidad** (p. ej. *"usuarios activos"*: ¿qué acciones? ¿se excluye a los fraudulentos? ¿qué ventana temporal?); (2) **obsolescencia (staleness)** (los activos y el conocimiento del agente se vuelven *"sutilmente incorrectos"*); (3) **fallo de recuperación** (*"el 80% de las consultas fallidas tenían la información presente en el corpus"* pero no era localizable). **Solución = una "pila de analítica agéntica" de 4 capas**: (L1) **Fundamentos de datos** — modelado dimensional, **conjuntos de datos canónicos** *"fuente única de verdad"*, metadatos *"como producto de primera clase"*, integridad vía CI/CD; (L2) **Fuentes de verdad** en orden decreciente de confianza — **semantic layer** (el agente está *"estructuralmente obligado (por instrucción de la skill) a recurrir primero a la semantic layer"*), grafo de linaje, **corpus de consultas** (destilado en documentos estructurados, **no** recuperación en bruto), contexto de negocio (grafo de conocimiento: hojas de ruta, registros de decisiones, organización); (L3) **Skills** — la palanca decisiva: ***"sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%"***; estructuradas **en pares** (*Knowledge skill* = enrutador hacia ~30 archivos de referencia; *Unbook skill* = flujo de trabajo de analista senior: aclarar → buscar fuentes → ejecutar → **revisión adversarial**); mantenimiento **colocalizado** (*"un hook de revisión de código señala cualquier cambio del modelo de reporting que no toque un archivo de skill"* → **~90% de las PR de datos incluyen un cambio de skill**); (L4) **Validación** — evaluaciones offline (umbral ~90% para lanzar un agente, objetivo ~100%), **pruebas de ablación** (resultado negativo notable: grep en bruto sobre miles de archivos SQL → la precisión se mueve *"menos de un punto"*), online (revisión adversarial: **+6% de precisión, +32% de tokens, +72% de latencia**), **pies de página de procedencia** (nivel de fuente + frescura + propiedad), **recolección activa de correcciones** (agentes programados que escanean canales para redactar correcciones en markdown). **Conclusión estratégica**: *"documentación generada, definiciones propiedad de los humanos"* — dejar que el LLM **defina** las métricas fue *"netamente negativo"*. **Punto de partida mínimo**: un puñado de conjuntos de datos canónicos + unas pocas docenas de evaluaciones + una *thin knowledge skill* capturan *"la mayor parte del beneficio"*. Converge fuertemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = carpetas, Gotchas, hooks), la doctrina de *systems around the model* de [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], la **semantic layer / ontología** de talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 y seale-semantic-agent-model-harness-ontology-data-2026-04-17, el *context development lifecycle* de debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, y la UDA/grafo de conocimiento de netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.
#analítica self-service#analítica de datos agéntica#Claude Code
**Chen Chang · Clement Peng · Justin Leder · Johanne Jiao · Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog) · catégorie *Enterprise AI* · ~5 min de lecture.