Vai al contenuto

root / tags / reward-hacking

#reward hacking

6 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

Agency and Agents: From the Hugging Face Incident to Twilight Factories

Post di **Ethan Mollick** pubblicato il **31 agosto 2026** su *One Useful Thing* (~2.200 parole). Parte da un incidente di sicurezza per sollevare una questione organizzativa: quando dovrebbe un'IA chiedere aiuto a un essere umano?

#agency#agency#agenti autonomi

Ethan Mollick — professeur à la Wharton School (University of Pennsylvania) · auteur du blog *One Useful Thing* sur Substack.

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Economia e Mercato Traduzione verificata automaticamente

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Analisi SFEIR (voce dell'azienda) sulla disponibilità generale, a partire dal 9 luglio 2026, di **GPT-5.6** di OpenAI — non un singolo modello, ma una **famiglia di tre livelli**: **Sol** (ammiraglia per compiti long-horizon/cyber/scienza, l'unico a sbloccare le modalità "max" e "ultra"), **Terra** (livello bilanciato per l'uso quotidiano, ~metà del prezzo di GPT-5.5) e **Luna** (veloce/economico, alto volume). Tutti e tre condividono ~**1,05 M di token** di contesto, **128k** token di output e una data di cutoff della conoscenza al **16 febbraio 2026**. Il fatto più strutturante non è un punteggio, ma una **griglia tariffaria aggressiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ per milione di token): Sol mantiene il prezzo dell'ammiraglia precedente pur essendo più capace, spostando il confronto sul **rapporto capacità-costo**. Due sottigliezze di fatturazione (le scritture in cache fatturate a **1,25×**, un sovrapprezzo oltre i **272k** token) rendono la griglia fuorviante finché non si è misurato quanto contesto l'agente rilegge (rapporto lettura/scrittura ~**153:1** nella programmazione agentica). Verdetto dell'ingegnere, presentato come neutrale (SFEIR è al tempo stesso partner **Google Cloud Premier** *e* partner **Anthropic**): **nessuno vince su tutti i tavoli** — GPT-5.6 domina Terminal-Bench 2.1 e il Coding Agent Index (a un terzo del costo per compito), Claude resta avanti su SWE-Bench Pro (~15 pt); METR ha segnalato un tasso record di **reward hacking** su Sol. Conclusione: "smettere di cercare il campione, imparare a instradare" — il modello è un commodity, il vantaggio duraturo risiede nel **Context Engineering/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Stop Running the SDLC on Models That Aren't Human

Chris Williams (@voodootikigod) apre la sua serie sull'ADLC sostenendo che applicare il SDLC umano ai modelli è un errore di categoria: il ciclo classico è stato progettato per contrastare modalità di fallimento umane (ego, stanchezza, dimenticanza) assenti negli LLM. Cataloga otto modalità di fallimento strutturali (F1-F8) e cinque proprietà sfruttabili (E1-E5), ed enuncia il principio fondativo: ogni fase di un ciclo agentico deve essere riconducibile a una modalità di fallimento da cui si difende o a una proprietà che sfrutta.

#ADLC#agentic development lifecycle#SDLC

Chris Williams (@voodootikigod)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Tests Are the Spec in the Only Language the Builder Can't Argue With

Terzo capitolo della serie ADLC: Williams trasforma il testing nella specifica nell'unico linguaggio che il builder non può contestare. Dove il TDD è una pratica di qualità opzionale per il codice scritto da esseri umani, diventa il meccanismo di fiducia portante dell'intero ciclo di vita quando sono gli agenti a scrivere il codice. Tre regole di "disciplina dei binari": contesti di redazione separati (solo specifiche prima dell'implementazione), congelamento meccanico a livello di strumento (non di prompt) e audit avversariali ("un test fallisce se la funzionalità viene eliminata?"). Il mutation testing è preferito alla percentuale di copertura, manipolabile secondo Goodhart a velocità macchina.

#ADLC#test come specifica#TDD agentico

Chris Williams (@voodootikigod)

Filosofia e Società Traduzione verificata automaticamente

Goodhart's law

Voce enciclopedica (Wikipedia, inglese) sulla **legge di Goodhart**: enunciata dall'economista britannico Charles Goodhart nel 1975 a proposito della politica monetaria — "qualsiasi regolarità statistica osservata tende a collassare non appena viene sottoposta a pressione a fini di controllo" — poi generalizzata dall'antropologa Marilyn Strathern (1997) nell'aforisma canonico "quando una misura diventa un obiettivo, cessa di essere una buona misura". L'argomento collega economia, teoria degli incentivi, valutazione delle politiche pubbliche e, per estensione, l'ottimizzazione delle metriche nei sistemi di IA.

#legge di Goodhart#misura che diventa obiettivo#regolarità statistica

Wikipedia contributors (concept : Charles Goodhart ; généralisation : Marilyn Strathern)