Post di **Ethan Mollick** pubblicato il **31 agosto 2026** su *One Useful Thing* (~2.200 parole). Parte da un incidente di sicurezza per sollevare una questione organizzativa: quando dovrebbe un'IA chiedere aiuto a un essere umano?
#agency#agency#agenti autonomi
Ethan Mollick — professeur à la Wharton School (University of Pennsylvania) · auteur du blog *One Useful Thing* sur Substack.
Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.
#GLM-5.3#GLM-5.2#Z.ai
**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.
Lettera "Dear friends" di Andrew Ng su *The Batch* (DeepLearning.AI, numero 359) sul **loop engineering** applicato allo sviluppo di prodotto **0-to-1**. Ng condivide i suoi **3 loop chiave** — loop di coding agentico (~minuti), loop di feedback dello sviluppatore (~ore), loop di feedback esterno (~giorni) — annidati per scala temporale crescente, collegando *coding agent → product spec/evals → visione dello sviluppatore → feedback esterno*. Tesi centrale: gli esseri umani mantengono un **vantaggio di contesto** (piuttosto che un "gusto") che rende indispensabile l'human-in-the-loop; gli ingegneri assumono un ruolo parziale di product management. Dominio: coding agent, product engineering, metodologia agentica.
#Loop engineering#sviluppo di prodotto#loop di coding agentico
Post di svago domenicale di **Mark Dembo** (Head of Solutions, Developer Platform & AI presso **Cloudflare**) pubblicato il **7 giugno 2026** sul suo blog personale. **Narrazione**: ispirato da **Steve Ruiz**, l'autore acquista un piccolo dispositivo **M5Stack Stick 3** (~30€) e, approfittando del rilascio di **Opus 4.8**, si costruisce un **agente AI DIY** "per pura curiosità, senza alcun obiettivo". **Iterazione 1 (45 min)**: sottopone la documentazione del dispositivo a **Claude Code**, che genera script Python (~200 righe di codice, *"zero blast radius"*) che mostrano il meteo di Monaco di Baviera, poi di più città; un **backend Cloudflare Workers + Workers AI** aggiunge **sintesi vocale (TTS)**, **push-to-talk** (riconoscimento vocale) e un **piccolo LLM** centrale per rispondere alle domande. **Iterazione 2 (un vero agente)**: passaggio degli endpoint REST al trasporto **WebSocket** tramite il **Cloudflare Agents SDK** + **Dynamic Worker execution** → il pattern ***"Code Mode"*** (l'agente scrive ed esegue codice per portare a termine il suo compito). L'agente risponde quindi a domande su dati pubblici (11! = fattoriale, il vincitore della Champions League via `fetch()` su Wikipedia, il meteo di qualsiasi città). **Iterazione 3 (poteri reali)**: connessione a **Todoist** tramite un flusso **MCP OAuth** → 50 strumenti in un colpo solo, da cui due problemi: **context bloat** e **rischio reale di danni**. La soluzione si basa sul **MCP Server Portal** di Cloudflare + le impostazioni dei connettori Claude: per ogni strumento, **Always allow / Ask for approval / Disable** (gli strumenti *Disabled* non entrano mai nel contesto; un **classificatore LLM** accetta solo autorizzazioni "allow" distinte e **nega per default**). **Postura dichiarata**: ridurre il proprio ruolo a ***"generatore di idee, esecutore e giudice"*** (e raramente guida tecnica), un flusso "human-in-the-loop" che considera poco *"2026"* (copia-incolla in UIFlow). **Cosa NON ha fatto**: nessuna ottimizzazione di latenza/streaming, nessuna chiamata LLM ottimistica, nessuna valutazione (eval), ***"non ho nemmeno guardato il codice una sola volta"***. **Stupore**: 30€ + una finestra di sessione Anthropic + qualche centesimo di inferenza Cloudflare → un oggetto che ascolta e parla, pilotato in linguaggio naturale; *"il vero sblocco è quanto sia accessibile."* Contrasto netto con [[thomas-pragdave-failing-faster-code-rot-ai-velocity-2026-06-06]] (qui *"zero blast radius"* giustifica il non guardare mai il codice); illustra concretamente il *Code Mode* / *"l'agente che scrive ed esegue codice"*, il pattern **MCP** ([[claude-skills-bigger-than-mcp-willison-2025-10-16]]), la governance degli strumenti in stile *Ask for approval* (uber-engineering-agent-identity-crisis-zero-trust-spire-2026-05-21), e la dottrina dei *systems around the model* di dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28.
#BYO agent#bring your own AI#svago tecnologico
**Mark Dembo** (@darkmembo / @mdembo) · **Head of Solutions – Developer Platform & AI** chez **Cloudflare** (auparavant auteur sur le blog Cloudflare). Billet personnel publié sur son blog *markpauldembo.com* le **7 juin 2026** (description : *« Thoughts about tinkering on a Sunday »*).
Thread X in stile manifesto di Rohit (@rohit4verse) che delinea la *2026 AI engineer roadmap*: un divario di 150.000 dollari tra prompt engineer e systems architect, la fine dei *generic wrapper* "sherlockati dai big tech", e 5 progetti da portfolio classificati per livello di complessità (SLM mobile offline, agente di coding auto-migliorante, *Cursor for video editors* multimodale, agente personal life OS privacy-first, agente autonomo per workflow aziendali). Ogni progetto descrive le sue *decisioni architetturali chiave* (lazy loading, sliding window, sandboxing, scene detection, grafo di conoscenza personale, multi-agente event-driven, audit trail, RBAC, observability). Slogan strutturante: *"il sostituibile: costruire wrapper / l'inlicenziabile: spedire sistemi autonomi"*. Tono ingiuntivo e virale tipico di X nel 2026.
#2026 AI engineer roadmap#Rohit#rohit4verse
Rohit (@rohit4verse) — créateur de contenu IA sur X · vulgarisateur d'architecture et roadmaps de carrière en ingénierie IA.
Ethan Mollick - Evoluzione IA in 3 Anni da GPT-3 a Gemini 3 - Dai Chatbot agli Agenti - Il Codice come Interfaccia Universale - Intelligenza di Livello PhD - Human-in-the-loop Antigravity
Framework strategico IA générative - 4 quadranti di implementazione - Paradosso dell'accesso - Dati come fossato competitivo - Differenziazione strategica - Harvard Business Review - Bharat N. Anand - Andy Wu
#strategia dell'IA generativa#vantaggio competitivo#framework a quattro quadranti
Bharat N. Anand (NYU Stern School of Business Dean) · Andy Wu (Harvard Business School)