Vai al contenuto

root / tags / auditabilite

#auditabilité

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Una nota di veille di **Didier Girard** pubblicata su **X** il **7 agosto 2026**, che legge il lancio di **Shieldstral 1.0 3B** (Mistral AI, 4 agosto 2026) non come il lancio di un prodotto ma come **il dispiegamento in produzione di una dottrina**. Punto di partenza: il **13 maggio 2026**, davanti alla commissione d'inchiesta dell'Assemblea Nazionale sulle vulnerabilità digitali, **Arthur Mensch** ha rifiutato qualsiasi ruolo di supervisione per Mistral sull'uso finale dei suoi modelli — *"non abbiamo legittimità democratica"* — respingendo esplicitamente la posizione di **Anthropic**. Meno di tre mesi dopo, Mistral rilascia un **modello di moderazione**. L'autore smonta l'apparente contraddizione: **Shieldstral non porta con sé alcuna tassonomia del lecito e dell'illecito**, risponde a una **domanda che l'utente scrive**. **Il meccanismo è il cuore della nota**: un prompt in tre parti (contesto + gravità / un'unica domanda chiusa / il contenuto da giudicare), una risposta `yes` o `no`, e il **softmax su questi due token** produce un punteggio continuo tra 0 e 1. **La politica di moderazione non è nei pesi, viene letta al momento dell'inferenza** — mentre **Llama Guard 4** incorpora la tassonomia MLCommons fissata in fase di addestramento, Shieldstral legge la vostra in linguaggio naturale, modificabile **senza ri-addestramento**. Il rapporto tecnico (**arXiv:2607.25857**, 28 luglio 2026) quantifica il costo di questa scelta: fine-tuning sui soli dati pubblici = **61,1% F1** sull'adattabilità della policy; **4,4 milioni di coppie contrastive** generate da un LLM (lo stesso contenuto riscritto per violare una policy ma non la sua policy gemella) = **+23,3 punti**; **91,3%** dopo la fusione di tre checkpoint. Caratteristiche: **3,8 miliardi di parametri effettivi** (il "3B" del nome arrotonda per difetto), base **Ministral 3** + encoder visivo **Pixtral**, **12 lingue**, **16 GB di VRAM in BF16**, **Apache 2.0**. Prestazioni testuali: **84,9% F1 medio**, alla pari con **GPT-OSS-Safeguard-20B** (sette volte più grande), davanti a **Qwen3Guard-8B** (84,0) e ben davanti a **LlamaGuard-4-12B** (69,1). **Una riserva sollevata dall'autore stesso**: *tutte queste cifre provengono da Mistral, su set di test selezionati da Mistral, e al 6 agosto non esisteva alcuna valutazione di terze parti*. La tesi strutturante della nota è un'**opposizione di topologie**: in **Anthropic**, il guardrail vive **nei pesi** e l'editore arbitra chi ne è esentato (**Claude Fable 5** pubblico con misure di sicurezza / **Claude Mythos 5** senza, riservato ai cyberdifensori approvati di **Project Glasswing**, 9 giugno 2026); in **Mistral**, il guardrail **sta fuori dal modello** — un componente separato, aperto, auto-ospitabile, la cui policy appartiene al deployer. Allineamento esplicito con i clienti (ministero delle Forze Armate, BNP Paribas, amministrazioni pubbliche francesi e lussemburghesi). La nota si chiude su una **battuta d'arresto documentata in tre punti**: **auditabilità** (output binario, nessuna traccia di ragionamento, mentre il deployer eredita l'onere della giustificazione in un audit AI Act), **robustezza** (il primo capitolo del *Trattato sulla tolleranza* di Voltaire classificato come "incitamento alla violenza" da un tester nel thread di Hacker News — una confusione tra menzione ed endorsement), **disponibilità** (al 6 agosto: nessun endpoint a pagamento su La Plateforme, nessun Ollama ufficiale). Tre regole di dispiegamento a chiusura.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Trasformazione e Adozione Traduzione verificata automaticamente

IFTTD #351 - AWS Summit : Rester aux commandes des agents de code (avec Julien Lépine)

Episodio #351 del podcast francofono **If This Then Dev** (Bruno) con **Julien Lépine**, Chief Technology Officer di **AWS France** (13 anni in Amazon), registrato a margine dell'**AWS Summit Paris** (1° aprile 2026, ~10.000 partecipanti). Tesi centrale: nell'era agentica, scrivere codice diventa secondario, e il valore si sposta verso **la comprensione del contesto, i compromessi architetturali e la responsabilità umana**. Prova centrale: **la riprogettazione di Amazon Bedrock** — una piattaforma critica che gestisce migliaia di miliardi di richieste — realizzata da un team di **6 persone in 72 giorni** (contro una stima di 30 persone / 18 mesi), **codice interamente generato dall'IA**, senza vibe coding. AWS sta **standardizzando internamente su Kiro** (IDE + CLI, basato su Claude Sonnet/Opus) per ~30.000 sviluppatori (annunciato da Matt Garman a re:Invent). Filo conduttore: **mantenere il controllo** senza rivedere tutto — tramite **modellazione formale (TLA+)** e **Raisonnement automatisé** per dimostrare invarianti e delimitare gli agenti, **blameless post-mortem**, e il principio secondo cui "la responsabilità dell'azione di un agente ricade su chi lo opera". Emergenza dell'**AI DLC** (sprint → più **Bolt** giornalieri) e rischio di **sovraccarico cognitivo / burn-out**.

#AWS Summit Paris#Amazon Web Services#agenti di codice

**Julien Lépine** — Directeur de la technologie (CTO) d'Amazon Web Services France · 13+ ans chez Amazon ; ses équipes accompagnent les clients AWS sur le cloud · la data et l'IA. **Hôte** : Bruno (créateur et animateur du podcast *If This Then Dev*).