Aller au contenu

root / tags / project-glasswing

#Project Glasswing

2 fiches

Qualité & Sécurité

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Note de veille de **Didier Girard** publiée sur **X** le **7 août 2026**, qui lit le lancement de **Shieldstral 1.0 3B** (Mistral AI, 4 août 2026) non comme une sortie produit mais comme **la mise en production d'une doctrine**. Point de départ : le **13 mai 2026**, devant la commission d'enquête de l'Assemblée nationale sur les vulnérabilités numériques, **Arthur Mensch** refusait tout droit de regard de Mistral sur l'usage final de ses modèles — *« nous n'avons pas la légitimité démocratique »* — en écartant explicitement la posture d'**Anthropic**. Moins de trois mois plus tard, Mistral publie un **modèle de modération**. L'auteur écarte la contradiction apparente : **Shieldstral ne porte aucune taxonomie du licite et de l'illicite**, il répond à une **question que l'utilisateur écrit**. **Le mécanisme est le cœur de la note** : un prompt en trois parties (contexte + sévérité / une seule question fermée / le contenu à juger), une réponse `yes` ou `no`, et la **softmax sur ces deux tokens** produit un score continu entre 0 et 1. **La politique de modération n'est pas dans les poids, elle est lue à l'inférence** — là où **Llama Guard 4** embarque la taxonomie MLCommons figée à l'entraînement, Shieldstral lit la vôtre en langage naturel, modifiable **sans réentraînement**. Le rapport technique (**arXiv:2607.25857**, 28 juillet 2026) chiffre le coût de ce choix : fine-tuning sur données publiques seules = **61,1 % de F1** en adaptabilité aux politiques ; **4,4 millions de paires contrastives** générées par LLM (même contenu réécrit pour violer une politique mais pas sa politique sœur) = **+23,3 points** ; **91,3 %** après fusion de trois checkpoints. Caractéristiques : **3,8 Md de paramètres réels** (le « 3B » du nom arrondit vers le bas), base **Ministral 3** + encodeur vision **Pixtral**, **12 langues**, **16 Go de VRAM en BF16**, **Apache 2.0**. Performance texte : **84,9 % de F1 moyen**, à égalité avec **GPT-OSS-Safeguard-20B** (sept fois plus gros), devant **Qwen3Guard-8B** (84,0) et loin devant **LlamaGuard-4-12B** (69,1). **Réserve posée par l'auteur lui-même** : *tous ces chiffres viennent de Mistral, sur des jeux de test que Mistral a sélectionnés, et aucune évaluation tierce n'existait au 6 août*. La thèse structurante est une **opposition de topologies** : chez **Anthropic**, le garde-fou vit **dans les poids** et l'éditeur arbitre qui y échappe (**Claude Fable 5** public avec mesures de sécurité / **Claude Mythos 5** sans, réservé aux cyberdéfenseurs approuvés du **Project Glasswing**, 9 juin 2026) ; chez **Mistral**, le garde-fou **sort du modèle** — composant séparé, ouvert, auto-hébergeable, dont la politique appartient au déployeur. Alignement client explicite (ministère des Armées, BNP Paribas, administrations françaises et luxembourgeoise). La note se termine sur un **revers en trois points documentés** : **auditabilité** (sortie binaire, aucune trace de raisonnement, alors que le déployeur hérite de la charge de justification en audit AI Act), **robustesse** (le premier chapitre du *Traité sur la tolérance* de Voltaire classé « appelle à la violence » par un testeur du fil Hacker News — confusion mention/adhésion), **disponibilité** (au 6 août : pas d'endpoint facturé sur La Plateforme, pas d'Ollama officiel). Trois règles de déploiement en clôture.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Économie & Marché

Claude Fable 5 and Claude Mythos 5

Anthropic lance Claude Fable 5 (modèle de classe Mythos rendu sûr pour usage général) et Claude Mythos 5 (même modèle, garde-fous levés, réservé aux cyberdéfenseurs via Project Glasswing) : performances état de l'art en ingénierie logicielle, vision, mémoire long-contexte et sciences du vivant.

#Claude Fable 5#Claude Mythos 5#modèle de fondation

Anthropic