Vai al contenuto

root / tags / revue-adversariale

#revue adversariale

3 fiches

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Rewriting Bun in Rust

Resoconto tecnico di prim'ordine di **Jarred Sumner**, creatore di **Bun** (runtime JS/TS, >22M download/mese), sulla **riscrittura completa di Bun da Zig a Rust in 11 giorni** (3→14 maggio 2026) guidata da **Claude** — un caso di studio eccezionale di ingegneria del software assistita dall'IA **su scala industriale**. Motivazione: una classe ricorrente di bug (use-after-free, double-free, leak) derivante dal mix di memoria gestita da GC (JavaScriptCore) e memoria manuale (Zig); in **Rust sicuro**, questi bug diventano **errori di compilazione** con pulizia automatica (`Drop`/RAII) — "un ciclo di feedback migliore di una guida di stile". Rifiutando il dogma secondo cui "una riscrittura è sempre una cattiva idea" (un anno di blocco delle correzioni di bug per 3 ingegneri), Sumner sceglie un **porting meccanico** (preservare l'architettura, cambiamento minimo del comportamento) validato dalla **suite di test esistente, scritta in TypeScript e quindi indipendente dal linguaggio** (60.624 test, 1,39M asserzioni `expect()`, 0 test rimossi, 6 piattaforme). L'harness: **~50 workflow dinamici** in **Claude Code**, cicli *scrittura → 2+ revisori avversari → applicazione*, fino a **64 istanze Claude in parallelo** (4 worktree × 16), con **PORTING.md** + **LIFETIMES.tsv** generati in preparazione. Numeri: **6.502 commit** (picco 695/h, 58/min, ~1.300 righe/min), diff finale **+1.009.272 righe**, ~16.000 errori di compilazione trattati come una coda, **5,9 miliardi di token di input non in cache + 690M di output ≈ 165.000 $**. Leve metodologiche chiave: la **revisione avversaria** (un secondo Claude, contesto separato, vede solo il diff, incaricato di trovare perché è sbagliato — individua bug sottili che sono *semanticamente* diversi ma *sintatticamente* identici) e il principio **"correggere il processo che genera il codice, non il codice a mano".** Modello utilizzato: una pre-release di **Claude Fable 5** (classe Mythos). Dopo il merge: **11 round di revisione di sicurezza Claude Code**, fuzzing guidato dalla copertura 24/7 (100 miliardi di esecuzioni → ~15 PR), **4% di codice `unsafe`** (78% su una singola riga), **19** regressioni note corrette. In produzione: Claude Code v2.1.181, la prima release su Bun-in-Rust, **+10% di avvio più veloce su Linux**. Dichiarato in apertura: **Bun è stato acquisito da Anthropic nel dicembre 2025**.

#Bun#Jarred Sumner#riscrittura da Zig a Rust

Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Prosecution, Not Code Review

Quarto capitolo della serie ADLC: Williams riformula la revisione del codice come "accusa" avversariale piuttosto che come valutazione collaborativa. Assegna agli agenti il mandato di confutare ("trovare cosa non va"), impiega revisori a lente singola con contesti nuovi (correttezza, sicurezza, conformità contrattuale, aderenza alle specifiche, qualità dei test), agisce solo su riscontri verificati (riprodotti da un test che fallisce) e itera fino a due passaggi consecutivi con zero riscontri. Misura la calibrazione introducendo bug noti, secondo uno schema simile al mutation testing. Gate di uscita: zero riscontri aperti, due passaggi a vuoto, test verdi, diff dei test vuoto.

#ADLC#prosecution#adversarial review

Chris Williams (@voodootikigod)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

How Anthropic enables self-service data analytics with Claude

Approfondimento tecnico del team **Data Science & Data Engineering** di Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) pubblicato il **3 giugno 2026** sul blog Anthropic (categoria *Enterprise AI*, incentrato su **Claude Code**). **Risultato principale**: ***"il 95% delle query di business analytics viene automatizzato da Claude, con un'accuratezza aggregata del ~95%"*** (fino al **~99%** in alcuni ambiti). **Problema di fondo**: l'analytics **non** è codice — *"spesso esiste un'unica risposta corretta a partire da un'unica fonte corretta"* — richiede di **mappare la domanda dell'utente su entità precise e aggiornate** nel modello dei dati. Tre **modalità di fallimento**: (1) **ambiguità concetto↔entità** (es. *"utenti attivi"*: quali azioni? escludere i truffatori? quale finestra temporale?); (2) **obsolescenza** (gli asset e la conoscenza dell'agente diventano *"sottilmente errati"*); (3) **fallimento del retrieval** (*"l'80% delle query fallite aveva l'informazione presente nel corpus"* ma introvabile). **Soluzione = uno "stack di analytics agentico" a 4 livelli**: (L1) **Fondamenta dei dati** — modellazione dimensionale, **dataset canonici** *"fonte unica di verità"*, metadati *"come prodotto di prima classe"*, integrità tramite CI/CD; (L2) **Fonti di verità** in ordine decrescente di affidabilità — **semantic layer** (l'agente è *"strutturalmente obbligato (per istruzione della skill) a utilizzare prima il semantic layer"*), grafo di lineage, **corpus di query** (distillato in documenti strutturati, **non** retrieval grezzo), contesto di business (grafo di conoscenza: roadmap, decision log, organizzazione); (L3) **Skills** — la leva decisiva: ***"senza skill … non si superava il 21% … Aggiungendo le skill questi numeri salgono stabilmente oltre il 95%"***; strutturate **in coppie** (*Knowledge skill* = router verso ~30 file di riferimento; *Unbook skill* = workflow da analista senior: chiarire → trovare le fonti → eseguire → **revisione avversariale**); manutenzione **colocata** (*"un hook di code review segnala qualsiasi modifica al modello di reporting che non tocchi un file di skill"* → **~90% delle PR sui dati include una modifica a una skill**); (L4) **Validazione** — eval offline (soglia ~90% per lanciare un agente, obiettivo ~100%), **ablation testing** (risultato negativo notevole: grep grezzo su migliaia di file SQL → l'accuratezza si muove *"meno di un punto"*), online (revisione avversariale: **+6% accuratezza, +32% token, +72% latenza**), **footer di provenienza** (livello della fonte + freschezza + proprietà), **raccolta attiva di correzioni** (agenti pianificati che scansionano i canali per redigere correzioni in markdown). **Intuizione strategica**: *"documentazione generata, definizioni possedute dagli esseri umani"* — lasciare che l'LLM **definisca** le metriche si è rivelato *"netamente negativo"*. **Punto di partenza minimo**: una manciata di dataset canonici + qualche decina di eval + una *knowledge skill leggera* catturano *"la maggior parte del vantaggio"*. Converge fortemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = cartelle, Gotchas, hook), la dottrina dei *sistemi attorno al modello* di [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], il **semantic layer / ontologia** di talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 e seale-semantic-agent-model-harness-ontology-data-2026-04-17, il *context development lifecycle* di debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, e l'UDA/knowledge graph di netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

#self-service analytics#agentic data analytics#Claude Code

**Chen Chang · Clement Peng · Justin Leder · Johanne Jiao · Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog) · catégorie *Enterprise AI* · ~5 min de lecture.