Vai al contenuto

root / tags / 3

#3

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Una nota di veille di **Didier Girard** pubblicata su **X** il **7 agosto 2026**, che legge il lancio di **Shieldstral 1.0 3B** (Mistral AI, 4 agosto 2026) non come il lancio di un prodotto ma come **il dispiegamento in produzione di una dottrina**. Punto di partenza: il **13 maggio 2026**, davanti alla commissione d'inchiesta dell'Assemblea Nazionale sulle vulnerabilità digitali, **Arthur Mensch** ha rifiutato qualsiasi ruolo di supervisione per Mistral sull'uso finale dei suoi modelli — *"non abbiamo legittimità democratica"* — respingendo esplicitamente la posizione di **Anthropic**. Meno di tre mesi dopo, Mistral rilascia un **modello di moderazione**. L'autore smonta l'apparente contraddizione: **Shieldstral non porta con sé alcuna tassonomia del lecito e dell'illecito**, risponde a una **domanda che l'utente scrive**. **Il meccanismo è il cuore della nota**: un prompt in tre parti (contesto + gravità / un'unica domanda chiusa / il contenuto da giudicare), una risposta `yes` o `no`, e il **softmax su questi due token** produce un punteggio continuo tra 0 e 1. **La politica di moderazione non è nei pesi, viene letta al momento dell'inferenza** — mentre **Llama Guard 4** incorpora la tassonomia MLCommons fissata in fase di addestramento, Shieldstral legge la vostra in linguaggio naturale, modificabile **senza ri-addestramento**. Il rapporto tecnico (**arXiv:2607.25857**, 28 luglio 2026) quantifica il costo di questa scelta: fine-tuning sui soli dati pubblici = **61,1% F1** sull'adattabilità della policy; **4,4 milioni di coppie contrastive** generate da un LLM (lo stesso contenuto riscritto per violare una policy ma non la sua policy gemella) = **+23,3 punti**; **91,3%** dopo la fusione di tre checkpoint. Caratteristiche: **3,8 miliardi di parametri effettivi** (il "3B" del nome arrotonda per difetto), base **Ministral 3** + encoder visivo **Pixtral**, **12 lingue**, **16 GB di VRAM in BF16**, **Apache 2.0**. Prestazioni testuali: **84,9% F1 medio**, alla pari con **GPT-OSS-Safeguard-20B** (sette volte più grande), davanti a **Qwen3Guard-8B** (84,0) e ben davanti a **LlamaGuard-4-12B** (69,1). **Una riserva sollevata dall'autore stesso**: *tutte queste cifre provengono da Mistral, su set di test selezionati da Mistral, e al 6 agosto non esisteva alcuna valutazione di terze parti*. La tesi strutturante della nota è un'**opposizione di topologie**: in **Anthropic**, il guardrail vive **nei pesi** e l'editore arbitra chi ne è esentato (**Claude Fable 5** pubblico con misure di sicurezza / **Claude Mythos 5** senza, riservato ai cyberdifensori approvati di **Project Glasswing**, 9 giugno 2026); in **Mistral**, il guardrail **sta fuori dal modello** — un componente separato, aperto, auto-ospitabile, la cui policy appartiene al deployer. Allineamento esplicito con i clienti (ministero delle Forze Armate, BNP Paribas, amministrazioni pubbliche francesi e lussemburghesi). La nota si chiude su una **battuta d'arresto documentata in tre punti**: **auditabilità** (output binario, nessuna traccia di ragionamento, mentre il deployer eredita l'onere della giustificazione in un audit AI Act), **robustezza** (il primo capitolo del *Trattato sulla tolleranza* di Voltaire classificato come "incitamento alla violenza" da un tester nel thread di Hacker News — una confusione tra menzione ed endorsement), **disponibilità** (al 6 agosto: nessun endpoint a pagamento su La Plateforme, nessun Ollama ufficiale). Tre regole di dispiegamento a chiusura.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

The Batch n°352 — "There Will Be No AI Jobpocalypse" (Andrew Ng)

Editoriale di Andrew Ng su The Batch n°352 dell'8 maggio 2026 — **"There Will Be No AI Jobpocalypse"** — che smonta la narrazione della disoccupazione di massa causata dall'IA, basandosi sul tasso di disoccupazione USA **sano al 4,3%** e su assunzioni tech solide. Ng individua **tre motori** della narrazione del jobpocalypse: **(1) incentivi tecnologici** — i laboratori IA traggono vantaggio dal presentarsi come trasformativi-dirompenti (round di finanziamento, valutazioni, talenti); **(2) potere di determinazione dei prezzi** — i fornitori applicano **10.000+ $/anno** ai clienti enterprise **ancorando i propri prezzi allo stipendio del dipendente sostituito**, anziché al pricing SaaS tradizionale (per postazione / per utilizzo); **(3) comunicazione aziendale** — le imprese riformulano i propri licenziamenti come *"efficienza IA"* piuttosto che riconoscere le **assunzioni eccessive dell'era pandemica** del 2020-2022. Riconoscimento onesto: *"AI disrupts work"*. Ma Ng lo capovolge in **"AI jobapalooza"** (gioco di parole su Lollapalooza) — creazione di posti di lavoro nell'AI engineering e in campi affini, con competenze in evoluzione. Tensione implicita con **Amodei** (50% dei posti impiegatizi eliminati entro il 2030) — Ng fa notare, senza nominarlo, che **Anthropic trae vantaggio dal promuovere questa narrazione** (incentivi tecnologici). Pubblicato **lo stesso giorno** dell'articolo di **Wallace-Wells "AI Populism" sul NYT Magazine**: una lettura speculare perfetta — Ng = analisi economica a sangue freddo / Wallace-Wells = panico popolare. Convergenza sul potere di pricing con **"$100B cross-system labor" di Bain** (stessa tesi: pricing ancorato agli stipendi).

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu, ex-Coursera)