Vai al contenuto

root / tags / harnais-d-evaluation

#harnais d'évaluation

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

DeepSeek Harness developer preview: Everything is a plugin

Pagina prodotto ufficiale di **DeepSeek**, pubblicata il **13 agosto 2026**, **non firmata**, di circa 450 parole, che annuncia il rilascio in *developer preview* di **DeepSeek Harness** (`dsh`) — un harness per agenti di coding **open source con licenza MIT**, il cui repository è stato aperto lo stesso giorno. Una tesi in tre parole, ripetuta nel titolo e nella descrizione del repository: *« Everything is a plugin »*, affiancata da una seconda promessa, *« Every run is traceable »*. La pagina enuncia l'equazione *« AGENT = MODEL + HARNESS »* ed elenca le capacità innestabili come plugin — *« models, tools, skills, sessions, sandboxes, storage, loops, scheduling, and the UI »*. Vengono rilasciate quattro modalità: **modalità Standard** (agente di coding completo), **mode Code** (strumenti esposti tramite il *Code Mode SDK*, che permette al modello di comporre operazioni multi-step all'interno di un programma TypeScript), **mode Minimal** (*« two-tool coding agent with persistent bash and str_replace_editor »*, esplicitamente *« for benchmarking models in a minimal environment »*), e **modalità Creator** (ispezione a runtime, test di plugin in memoria). La sostanza tecnica risiede nel repository, non nella pagina: `docs/architecture.md` enuncia un invariante di logging — *« Model-visible means logged. Anything that reaches a model request must be reconstructable from the log, and a runtime invariant asserts it »* — e afferma che *« there is no privileged core to patch »*. Il nucleo tecnico non è farina del sacco di DeepSeek: DSH è costruito su **Cordis** (il progetto `cordiverse`, terza parte), **vendorizzato** in `vendor/` con un manifesto e una procedura di sincronizzazione, e la pagina colloca il *« Cordis paper »* allo stesso livello di navigazione di "GitHub" e "Developer docs". Vengono rilasciati due adapter LLM — `dsh-llm-deepseek` e `dsh-llm-pi-ai`, un adapter generico multi-provider. Il repository avverte in maiuscolo: *« THERE WILL BE COMPATIBILITY-BREAKING CHANGES »*, e `CLAUDE.md` specifica che `SESSION_FORMAT_VERSION` resta a `0` *« with no compatibility promise »*, con i backend che rifiutano i vecchi formati su disco. Cronologia: DSH viene rilasciato lo stesso giorno in cui **DeepSeek-V4-Pro raggiunge la GA**, tre giorni prima dell'entrata in vigore di un nuovo listino prezzi API il **16 agosto 2026 alle 16:00 UTC**, con tariffe di picco/fuori picco e uno sconto fuori picco del **−50%**.

#DeepSeek Harness#dsh#harness per agenti

**DeepSeek** (DeepSeek AI, laboratoire chinois) · en tant qu'institution. Page produit **non signée** : aucun auteur · aucun ingénieur mis en avant · aucun billet de blog ni papier technique associé. Le « nous » n'apparaît qu'une fois · en dernière phrase — *« We look forward to exploring the limits of intelligence with developers worldwide »*. Publiée le **13 août 2026**. La page est rendue en JavaScript : `curl` sur l'URL renvoie **HTTP 202 avec un corps vide** · le texte n'existant qu'après exécution du bundle. Deux documents de politique sont liés en pied de page — *Safe Use Policy* et *Data Processing Statement*.