The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis
L'editoriale di Andrew Ng su The Batch #350 delinea una gerarchia di accelerazione per gli agenti di coding in base al tipo di lavoro software: Frontend (massima) > Backend (moderata) > Infrastruttura (bassa) > Ricerca (minima).
Di Andrew Ng// Fonte deeplearning.ai ↗/Lettura 2 min/.md// Traduzione verificata automaticamente
Il 350° numero di The Batch, la newsletter settimanale di DeepLearning.AI pubblicata il 24 aprile 2026, si apre con un editoriale di Andrew Ng che delinea una gerarchia di accelerazione per gli agenti di coding in base al tipo di lavoro software. Ng propone una classificazione esplicita: il frontend beneficia dell'accelerazione massima (gli agenti sono "fluenti nei linguaggi frontend più diffusi come TypeScript e JavaScript" e possono iterare in un ciclo browser autonomo); il backend registra un'accelerazione moderata (i casi limite, la sicurezza e le migrazioni di database richiedono una supervisione umana esperta); l'infrastruttura beneficia poco degli agenti (gli LLM hanno una conoscenza "relativamente limitata" dei compromessi di rete e di sistema); e la ricerca resta in gran parte umana per il lavoro concettuale di formazione delle ipotesi, interpretazione e iterazione. Ng ne trae un insegnamento gestionale: calibrare le aspettative e l'organizzazione dei team in base a questi differenziali.
Il numero copre poi quattro notizie strutturanti. GLM-5.1 di Z.ai è un modello MoE con 754B parametri (40B attivi), sotto licenza MIT, capace di sostenere autonomamente un singolo compito fino a 8 ore tramite un ciclo pianifica-esegui-valuta. Prende la testa su SWE-Bench Pro con il 58,4% (contro il 54-57% dei concorrenti) e domina CyberGym (68,7), pur restando indietro sul ragionamento (GPQA Diamond 86,2% contro 94,3% di Gemini 3.1). Nel frattempo Z.ai ha aumentato i prezzi delle API di circa il 40%.
Agility Robotics sta dispiegando i suoi umanoidi Digit sulle linee di produzione di Schaeffler nella Carolina del Sud — il primo dispiegamento industriale operativo. Il costo operativo è stimato tra 10 e 25 $/h contro circa 20 $/h per una posizione umana entry-level. McKinsey prevede 5 milioni di umanoidi nelle fabbriche entro il 2040 (contro ~200 nel 2026).
La rivolta anti-data-center guadagna slancio: circa 64 miliardi di dollari di progetti bloccati o rinviati tra maggio 2024 e marzo 2025, una moratoria nel Maine per gli impianti ≥20MW, il primo referendum popolare nel Wisconsin e consiglieri destituiti nel Missouri. Due episodi violenti si sono distinti: un cocktail Molotov lanciato contro l'abitazione di Sam Altman a San Francisco, e colpi di arma da fuoco contro la residenza di un consigliere comunale di Indianapolis. Le lamentele riguardano la rete elettrica, le tariffe energetiche, il consumo d'acqua e il disturbo alla quiete.
Infine, dei ricercatori (Christina Lu, MATS, Oxford, Anthropic) introducono l'"assistant axis" — un vettore di aderenza alla persona addestrata che consente il capping delle attivazioni. Risultati: le risposte dannose in Qwen3 32B scendono dall'83% al 41%, in Llama 3.3 70B dal 65% al 33%, senza degradare IFEval/GSM8k/MMLU-Pro/EQ-Bench.
Punti chiave
Numero 350 di The Batch. pubblicato il 24 aprile 2026, ~15 minuti di lettura, editoriale di Andrew Ng.
Gerarchia di accelerazione per gli agenti di coding. (dal più al meno accelerato): 1. Frontend — "gli agenti di coding sono fluenti nei linguaggi frontend più diffusi come TypeScript e JavaScript". Ciclo autonomo agente-browser (l'agente testa i propri output in un browser, itera). Quando il design è specificato, l'implementazione è rapida. 2. Backend — accelerazione moderata. Lo sviluppatore deve guidare il modello attraverso i casi limite, le considerazioni di sicurezza e le migrazioni di database. Bug sottili + effetti a valle = supervisione umana esperta richiesta. 3. Infrastruttura — accelerazione la più debole. Gli LLM hanno una conoscenza "relativamente limitata" delle complessità e dei compromessi infrastrutturali. Test, sperimentazione e debug di configurazioni di rete errate richiedono una competenza ingegneristica profonda che va oltre le capacità attuali degli agenti. 4. Ricerca — accelerazione minima nonostante i guadagni legati al codice. Gli agenti accelerano la generazione di codice e l'orchestrazione degli esperimenti, ma il lavoro concettuale (formazione delle ipotesi, interpretazione, iterazione) resta umano.
Insegnamento gestionale."Comprendere queste distinzioni aiuta le organizzazioni a calibrare le aspettative e l'organizzazione dei team intorno alle capacità dell'IA."
Lettura speculare con Karpathy. (fiche [karpathy-vibe-coding-agentic-engineering-software-3-0-2026-04-29](karpathy-vibe-coding-agentic-engineering-software-3-0-2026-04-29.md)): Ng propone una gerarchia per dominio, Karpathy una spiegazione per verificabilità — i domini con un forte segnale di verifica (rendering visivo frontend, matematica/codice) eccellono; i domini sfumati (infrastruttura, ricerca concettuale) restano indietro. I due schemi sono congruenti. ### Notizia 1 — GLM-5.1 (Z.ai): agente autonomo di 8 ore
Architettura. MoE, 754B parametri totali, 40B attivi per token.
Contesto. 200.000 token in input, 128.000 in output.
Licenza. MIT, pesi aperti (HuggingFace).
Prezzi API. 1,40 $ / 0,26 $ (cached) / 4,40 $ per milione di token (input/cached/output).
Capacità distintiva. sostiene autonomamente un singolo compito fino a 8 ore, con un ciclo pianifica→esegui→valuta e abbandono adattivo dopo centinaia di chiamate a strumenti se l'approccio fallisce (invece di terminare prematuramente).
Prestazioni. leader su SWE-Bench Pro con il 58,4% (contro il 54-57% dei concorrenti); 3° su Arena Code (1530 Elo); record su CyberGym a 68,7; resta indietro su GPQA Diamond all'86,2% contro il 94,3% di Gemini 3.1.
Mercato. Z.ai ha aumentato i prezzi delle API di ~40% e raddoppiato il costo dell'abbonamento coding — riducendo il divario competitivo con le offerte proprietarie. ### Notizia 2 — Digit (Agility Robotics) sulla linea di produzione di Schaeffler
Primo dispiegamento operativo. di umanoidi nell'industria (Carolina del Sud, componenti auto).
Regime. due turni da 4 ore con ricarica; compiti specificati come workflow (non comandi motori diretti) — trasferimento di contenitori.
Economia. Agility stima il costo operativo tra 10 e 25 $/h contro ~20 $/h per una posizione umana entry-level. Schaeffler prevede centinaia di dispiegamenti negli USA + Europa entro il 2030.
Contesto globale. ~200 umanoidi nelle fabbriche nel 2026; proiezione McKinsey: 5 milioni entro il 2040.
Effetto sull'occupazione. la ricerca suggerisce una ristrutturazione piuttosto che un'eliminazione — promozione verso ruoli di supervisione. ### Notizia 3 — Rivolta anti-data-center
Scala. ~64 miliardi di dollari di progetti data-center bloccati o rinviati tra maggio 2024 e marzo 2025.
Legislazione. Maine — moratoria sugli impianti ≥20MW fino al 2027 (legge in attesa della firma del governatore). Wisconsin (Port Washington) — primo referendum statunitense che richiede un voto popolare per gli incentivi fiscali su megaprogetti. Missouri (Festus) — gli elettori hanno destituito i consiglieri comunali che avevano approvato un data center da 6 miliardi di dollari. Ohio — emendamento costituzionale proposto che vieta gli impianti ≥25MW.
Lamentele. pressione sulla rete elettrica, aumento delle tariffe energetiche residenziali, consumo d'acqua, disturbo da rumore, impatto sul vicinato, impronta ambientale.
Episodi violenti. (1) cocktail Molotov lanciato contro l'abitazione di Sam Altman a San Francisco; (2) colpi di arma da fuoco contro la residenza di un consigliere comunale di Indianapolis che aveva sostenuto un data center da 500 milioni di dollari.
Tensione strategica. le aziende tecnologiche vedono il data center come infrastruttura di sovranità IA contro la Cina — da cui l'espansione rapida nonostante la resistenza locale. ### Notizia 4 — "Assistant axis" (Christina Lu, MATS / Oxford / Anthropic)
Problema. gli LLM addestrati come assistenti subiscono una deriva della persona nelle conversazioni lunghe o emotivamente cariche — adottando tratti alternativi.
Soluzione. un "assistant axis" = un vettore derivato dagli output dei layer che misura l'aderenza alla persona assistente addestrata. Consente sia il rilevamento CHE la correzione della deriva.
Metodologia. 1.200 domande di sondaggio del carattere + 1.375 prompt di sistema alternativi; misurazioni su Gemma 2 27B / Qwen3 32B / Llama 3.3 70B; "activation capping" = vincolare gli output entro i parametri della persona assistente in fase di inferenza.
Risultati jailbreak.
Qwen3 32B: risposte dannose 83% → 41%
Llama 3.3 70B: risposte dannose 65% → 33%
Preservazione delle prestazioni. IFEval, GSM8k, MMLU-Pro, EQ-Bench stabili o migliorate — il rafforzamento dell'allineamento non compromette le capacità.
Esempio di impatto. una conversazione di 30 turni intorno a ideazione suicidaria — il modello non modificato deriva verso un tono inappropriato; la versione capped mantiene i limiti terapeutici + una guida compassionevole.
Implicazione. un mezzo pratico e leggero per stabilizzare la persona senza riaddestramento — adiacente al lavoro di Anthropic sul character training (cfr. [anthropic-measuring-political-bias-claude-2025-11-13](../2025-11/anthropic-measuring-political-bias-claude-2025-11-13.md)).
i coding agent accelerano il frontend più del backend, dell'infra e della ricerca
— Andrew Ng
l'infrastruttura è poco accelerata dagli LLM attuali
— Andrew Ng
il lavoro concettuale di ricerca resta prevalentemente umano
— Andrew Ng
Il grafo di conoscenza estratto da questa fiche — 16 entità, 24 relazioni.
In questo grafo :Andrew Ng · The Batch · DeepLearning.AI · Z.ai · GLM-5.1 · GLM · Agility Robotics · Digit · Schaeffler · Sam Altman · Christina Lu · Assistant axis · Activation capping · SWE-Bench Pro · Hiérarchie d'accélération · Mouvement anti-data-center