# girard-shieldstral-mistral-doctrine-garde-fou-2026-08-07

## Veille

Eine von **Didier Girard** verfasste Watch-Notiz, veröffentlicht auf **X** am **7. August 2026**, die den Launch von **Shieldstral 1.0 3B** (Mistral AI, 4. August 2026) nicht als Produktveröffentlichung liest, sondern als **die produktive Umsetzung einer Doktrin**. Ausgangspunkt: Am **13. Mai 2026** lehnte **Arthur Mensch** vor dem Untersuchungsausschuss der Nationalversammlung zu digitalen Verwundbarkeiten jede Aufsichtsrolle von Mistral über den Endgebrauch seiner Modelle ab – *„wir besitzen keine demokratische Legitimität“* – und wies damit explizit die Haltung von **Anthropic** zurück. Weniger als drei Monate später veröffentlicht Mistral ein **Moderationsmodell**. Der Autor entkräftet den scheinbaren Widerspruch: **Shieldstral trägt keine Taxonomie des Erlaubten und des Verbotenen in sich**, es beantwortet eine **vom Nutzer geschriebene Frage**. **Der Mechanismus steht im Zentrum der Notiz**: ein dreiteiliger Prompt (Kontext + Schweregrad / eine einzige geschlossene Frage / der zu beurteilende Inhalt), eine Antwort mit `yes` oder `no`, und der **Softmax über diese beiden Tokens** erzeugt einen kontinuierlichen Score zwischen 0 und 1. **Die Moderationsrichtlinie steckt nicht in den Gewichten, sie wird zur Inferenzzeit gelesen** – während **Llama Guard 4** die zur Trainingszeit fixierte MLCommons-Taxonomie einbettet, liest Shieldstral die eigene Richtlinie in natürlicher Sprache, änderbar **ohne erneutes Training**. Der technische Bericht (**arXiv:2607.25857**, 28. Juli 2026) beziffert die Kosten dieser Entscheidung: Fine-Tuning allein auf öffentlichen Daten = **61,1 % F1** bei der Anpassungsfähigkeit der Richtlinie; **4,4 Millionen kontrastive Paare**, von einem LLM generiert (derselbe Inhalt umgeschrieben, um eine Richtlinie zu verletzen, aber nicht die benachbarte Richtlinie) = **+23,3 Punkte**; **91,3 %** nach Zusammenführung von drei Checkpoints. Merkmale: **3,8 Mrd. tatsächliche Parameter** (das „3B“ im Namen ist abgerundet), Basis **Ministral 3** + Vision-Encoder **Pixtral**, **12 Sprachen**, **16 GB VRAM in BF16**, **Apache 2.0**. Textleistung: **84,9 % durchschnittlicher F1**, auf Augenhöhe mit **GPT-OSS-Safeguard-20B** (siebenmal größer), vor **Qwen3Guard-8B** (84,0) und weit vor **LlamaGuard-4-12B** (69,1). **Ein vom Autor selbst geäußerter Vorbehalt**: *all diese Zahlen stammen von Mistral, auf von Mistral ausgewählten Testdatensätzen, und bis zum 6. August existierte keine unabhängige Bewertung*. Die zentrale These der Notiz ist ein **Gegensatz der Topologien**: bei **Anthropic** wohnt das Sicherheitsnetz **in den Gewichten**, und der Anbieter entscheidet, wer davon ausgenommen wird (**Claude Fable 5** öffentlich mit Sicherheitsmaßnahmen / **Claude Mythos 5** ohne, vorbehalten zugelassenen Cyberverteidigern des **Project Glasswing**, 9. Juni 2026); bei **Mistral** liegt das Sicherheitsnetz **außerhalb des Modells** – eine separate, offene, selbst hostbare Komponente, deren Richtlinie dem Betreiber gehört. Explizite Kundenausrichtung (Verteidigungsministerium, BNP Paribas, französische und luxemburgische Regierungsverwaltungen). Die Notiz schließt mit einem **in drei Punkten dokumentierten Rückschlag**: **Auditierbarkeit** (binäre Ausgabe, keine Begründungsspur, während der Betreiber die Beweislast im Rahmen eines AI-Act-Audits trägt), **Robustheit** (das erste Kapitel von Voltaires *Traktat über die Toleranz*, von einem Tester im Hacker-News-Thread als „Aufruf zur Gewalt“ eingestuft – eine Verwechslung von Erwähnung und Befürwortung), **Verfügbarkeit** (Stand 6. August: kein kostenpflichtiger Endpunkt auf La Plateforme, kein offizielles Ollama-Angebot). Abschließend drei Einsatzregeln.

## Titre Article

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

## Date

2026-08-07

## URL

https://x.com/DidierGirard/status/2085622329720066233

## Keywords

Shieldstral, Shieldstral 1.0 3B, Mistral AI, Arthur Mensch, Moderationsmodell, Sicherheitsklassifikator, multimodaler Klassifikator, offene Gewichte, open-weights, Apache 2.0, Selbst-Hosting, Souveränität, Moderationsrichtlinie, Moderationstaxonomie, Richtlinie zur Inferenzzeit, Anpassungsfähigkeit der Richtlinie, dreiteiliger Prompt, geschlossene Frage, yes/no, Softmax über zwei Tokens, kontinuierlicher Score, Schwellenwertkalibrierung, Schwellenwert 0, 5, menschliche Prüfung, Llama Guard 4, LlamaGuard-4-12B, MLCommons, GPT-OSS-Safeguard-20B, Qwen3Guard-8B, F1, kontrastive Paare, synthetische Daten, Checkpoint-Zusammenführung, Model Merging, arXiv, technischer Bericht, Ministral 3, Pixtral, Vision-Encoder, 12 Sprachen, 16 GB VRAM, BF16, 3, 8 Milliarden Parameter, Anthropic, Claude Fable 5, Claude Mythos 5, Project Glasswing, Sicherheitsnetz in den Gewichten, Topologie des Sicherheitsnetzes, Übertragung der Verantwortung, Auditierbarkeit, Begründungsspur, AI Act, Rechtszentrum, Verteidigungsministerium, BNP Paribas, luxemburgische Regierungsverwaltung, SFEIR, Mistral-Microsoft, architektonische Eigenschaft, Fehlalarm, Erwähnung vs. Befürwortung, Voltaire, Traktat über die Toleranz, Hacker News, verschleierte Eingaben, Arabisch, Indonesisch, La Plateforme, Ollama, Community-Quantisierungen, Prüfsumme, Prompt Injection, Protokollierung, The Decoder, Jonathan Kemper

## Authors

**Didier Girard** — auteur de la note, publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle, il croise une **audition parlementaire** (Mensch, 13 mai), un **lancement produit** (Shieldstral, 4 août), un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Sources mobilisées et créditées dans le texte : **Mistral AI** (annonce, model card Hugging Face, docs) ; **Calvi, Sooriyarachchi, Pistilli, Lample et al.** (rapport technique arXiv:2607.25857) ; **Jonathan Kemper** (*The Decoder*, 5 août) ; le fil **Hacker News** du 4 août (471 points) ; l'audition d'**Arthur Mensch** ; l'annonce **Anthropic** du 9 juin ; l'analyse **SFEIR** de l'accord Mistral-Microsoft du 22 juillet.

## Ton

**Profil**: eine strategische Analysenotiz, die auf einer technischen Lektüre fußt, kurzes und dichtes Format, veröffentlicht als Thread. Weder ein Launch-Bericht noch ein Benchmark: eine **Demonstration doktrinärer Kohärenz**, gefolgt von einer Prüfung ihrer Schwachstellen.

**Stil**: gegliedert in **vier Bewegungen** – das scheinbare Paradox (Mensch verweigert die Entscheidung / Mistral veröffentlicht einen Moderator) → der Mechanismus, der es auflöst (die Richtlinie wird zur Inferenzzeit geschrieben) → der Gegensatz der Topologien (Anthropic vs. Mistral) → der Rückschlag (die Verantwortung kommt ohne ihr Werkzeug). Drei Merkmale:

1. **Der Einstieg über den scheinbaren Widerspruch**, sofort entkräftet. Der Text stellt ein Problem, bevor er ein Produkt vorstellt: Das macht aus einem Launch einen Gegenstand der Analyse.
2. **Der in der ersten Person übernommene Nutzungsvorbehalt** – *„ich äußere den Nutzungsvorbehalt.“* Die Zahlen werden zitiert **und dann** im selben Absatz relativiert, ohne dem Argument entzogen zu werden. Ein ehrliches statt eines werbenden Register.
3. **Die Symmetrie des letzten Drittels**. Nachdem der Autor die Kohärenz der Entscheidung verteidigt hat, widmet er dem Fehlenden ebenso viel Raum – Auditierbarkeit, Robustheit, Verfügbarkeit –, jeweils belegt durch eine überprüfbare Tatsache statt einer Meinung.

**Markante Formulierungen**: *„Mistral kompiliert seine Doktrin in 3,8 Milliarden Parameter“*, *„es beantwortet eine von dir geschriebene Frage“*, *„die Moderationsrichtlinie ist nicht erlernt, sie kommt nicht aus den Gewichten“*, *„zwei Orte, um das Sicherheitsnetz unterzubringen“*, *„die Verantwortung kommt ohne ihr Werkzeug“*, *„Mistral wird nicht entscheiden, was akzeptabel ist, es stellt das Werkzeug bereit, damit man selbst entscheidet“*, *„Apache 2.0, 16 GB VRAM, und die Verantwortung wird mit den Gewichten mitgeliefert“*.

**Epistemische Haltung**: **der architektonischen Entscheidung wohlgesinnt, ihrem Werkzeug gegenüber skeptisch**. Der Autor bestätigt die doktrinäre Kohärenz („ich sehe darin die eigentliche Kohärenz des Launches“), weigert sich jedoch, die eigenen Zahlen des Anbieters als Beweis zu behandeln, und listet drei operative Lücken auf. Die Quellenlage ist dicht für einen Social-Media-Beitrag: sieben belegte Quellen, präzise Daten, eine arXiv-Nummer.

## Pense-betes

- **Die zentrale Idee, für sich genommen bemerkenswert**: Die Frage lautet nicht *„welches Modell moderiert am besten?“*, sondern ***„wo wohnt das Sicherheitsnetz?“***. Zwei entgegengesetzte Antworten, im Abstand von zwei Monaten von zwei Anbietern gegeben: | | **Anthropic** (9. Juni 2026) | **Mistral** (4. August 2026) | |---|---|---| | Ort | **in den Gewichten des Modells** | **neben** dem Modell, eine separate Komponente | | Wer definiert die Richtlinie | der Anbieter | **der Betreiber** | | Wer ist vom Sicherheitsnetz ausgenommen | wer vom Anbieter zugelassen wird (Project Glasswing) | nicht anwendbar | | Vertriebsmodell | Fable 5 öffentlich / Mythos 5 eingeschränkt | Apache 2.0 offene Gewichte | → Dies ist keine technische Meinungsverschiedenheit, sondern eine Meinungsverschiedenheit darüber, **wer die Legitimität besitzt zu entscheiden, was erlaubt ist**. Siehe [[anthropic-claude-fable-5-mythos-5-2026-06-09]] für das gegensätzliche Lager und [[mensch-mistral-commission-enquete-vulnerabilites-numeriques-souverainete-ia-2026-05-13]] für Menschs frühere Position.
- **Der Mechanismus, in drei Zeilen**: Prompt = (1) Kontext + Schweregrad, (2) **eine einzige geschlossene Frage** („ruft dieser Inhalt zu Gewalt auf?“), (3) der zu beurteilende Inhalt. Ausgabe = `yes` / `no`, und der **Softmax über nur diese beiden Tokens** liefert einen **kontinuierlichen Score zwischen 0 und 1**. Praktische Konsequenz: Dies ergibt einen schwellenwertfähigen Skalar statt eines binären Urteils – genau das macht die Kalibrierung möglich (siehe unten).
- **Was wirklich neu ist**: Die **Richtlinie ist nicht erlernt**. Llama Guard 4 bettet die zur **Trainingszeit fixierte** MLCommons-Taxonomie ein; Shieldstral liest die eigene Richtlinie **in natürlicher Sprache zur Inferenzzeit**, und man ändert sie **ohne erneutes Training**. Das Modell lernt nicht *was verboten ist*, es lernt, *eine ihm vorgegebene Regel anzuwenden*.
- **Die Zahl, die den Rest erklärt** – die Anpassungsfähigkeit stammt nicht aus der Architektur, sondern aus den **eigens zum Training erzeugten Daten**: | Schritt | F1 „Anpassungsfähigkeit der Richtlinie“ | |---|---| | Fine-Tuning nur auf öffentlichen Datensätzen | **61,1 %** | | + 4,4 Mio. von einem LLM generierte **kontrastive Paare** | **+23,3 Pkt.** | | + Zusammenführung von drei Checkpoints | **91,3 %** | → Das **kontrastive Paar** ist das Konzept, das man wirklich behalten sollte: *derselbe Inhalt, umgeschrieben, um eine Richtlinie zu verletzen, aber nicht die benachbarte Richtlinie*. Es ist das einzige Signal, das das Modell zwingt, die Frage zu lesen statt ein Thema zu erkennen. Ein **übertragbares Muster** für jeden per Instruktion steuerbaren Klassifikator.
- **Das Datenblatt, um zu entscheiden, ob es auf der eigenen Hardware läuft**: **3,8 Mrd. tatsächliche Parameter** (das „3B“ ist abgerundet), Basis **Ministral 3** + Vision-Encoder **Pixtral** (daher **multimodal**: Text und Bild), **12 Sprachen**, **16 GB VRAM in BF16**, **Apache 2.0**. Dies ist die Klasse „eine Consumer-Grafikkarte“ – die Dimensionierung ist Teil des politischen Arguments, nicht nur des Produkts.
- **Die Benchmarks, mit Vorbehalt**: 84,9 % durchschnittlicher Text-F1, auf Augenhöhe mit **GPT-OSS-Safeguard-20B** (7× so groß), vor **Qwen3Guard-8B** (84,0), weit vor **LlamaGuard-4-12B** (69,1). **All diese Zahlen stammen von Mistral, auf von Mistral gewählten Testdatensätzen, ohne unabhängige Bewertung bis zum 6. August 2026.** Der Autor äußert den Vorbehalt selbst – man sollte ihn beim Zitieren des Ergebnisses nicht verlieren.
- **Die drei Einsatzregeln – das umsetzbare Ergebnis der Notiz**: 1. **Zwei Schwellenwerte kalibrieren** auf einem **hauseigenen** gelabelten Datensatz, anstatt den Standardwert 0,5 zu akzeptieren: automatische Freigabe unterhalb des ersten, automatische Ablehnung oberhalb des zweiten, **menschliche Prüfung dazwischen**. (Der kontinuierliche Score existiert genau dafür.) 2. **Die aktive Richtlinienfrage bei jeder Entscheidung protokollieren** – sie dient bei einem Audit als Begründung, da das Modell selbst keine liefert. 3. **Das Paar Erwähnung/Befürwortung und die tatsächlich genutzten Sprachen testen** vor dem produktiven Einsatz. → Und eine vierte, separate Regel: **einen eigenen Prompt-Injection-Detektor beibehalten**. *Shieldstral filtert Inhalte, es schützt keinen Agenten vor einem präparierten Dokument.* Eine Unterscheidung, die man nicht verwischen sollte – siehe [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]] und [[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]].
- **Der Voltaire-Test – das zitierwürdige Gegenbeispiel**: Im Hacker-News-Thread reicht ein Nutzer das **erste Kapitel des *Traktats über die Toleranz*** mit der Frage ein, ob dieser Text zu Gewalt gegen eine geschützte Gruppe aufruft. Antwort: **ja**. Der Klassifikator **verwechselt das Erwähnen von Gewalt mit deren Befürwortung** – der klassische Fehlalarm dieser Gattung, gewonnen an einem der Gründungstexte der Toleranz. Mistral räumt zudem Schwächen bei **verschleierten Eingaben**, **langen Dokumenten**, **Arabisch** und **Indonesisch** ein.
- **Die Auditierbarkeitslücke, die vor jedem regulierten Einsatz abzuwägen ist**: Die Ausgabe ist `yes`/`no` plus ein Score, **ohne Begründungsspur**. Dennoch erbt der Betreiber die Taxonomie, die Kalibrierung **und** die Beweislast, jede Entscheidung im Rahmen eines AI-Act-Audits zu rechtfertigen – **mit einem nackten Score als einzigem Beleg**. Dies ist genau der Preis der Topologie „Sicherheitsnetz außerhalb des Modells“: Die Verantwortung wird übertragen, das dazugehörige Werkzeug nicht.
- **Die Verfügbarkeit zum 6. August 2026 (ein datierter Status, der neu geprüft werden sollte)**: kein kostenpflichtiger Endpunkt auf **La Plateforme**, kein offizieller **Ollama**-Eintrag, **von der Community erstellte Quantisierungen**, innerhalb von 48 Stunden veröffentlicht, deren Prüfsumme überprüft werden muss. **Selbst-Hosting ist der einzige ernstzunehmende Weg** – konsequent mit dem Produkt, aber in der Praxis auf Teams beschränkt, die in der Lage sind, ein Modell selbst zu hosten.
- **Die Souveränitätslesart**: ein Filter, der **vor Ort** läuft, dessen **Richtlinie vor Ort bleibt**, dokumentiert im Hinblick auf den **AI Act** – dies ist ein Kästchen, das amerikanische Angebote für die von Mensch während der Anhörung genannten Kunden leer lassen (**Verteidigungsministerium, BNP Paribas**, **französische** und **luxemburgische** Regierungsverwaltungen). Dies knüpft direkt an die These aus sfeir-mistral-microsoft-souverainete-strategie-industrielle-2026-07-22 an: **Souveränität wird Abhängigkeit für Abhängigkeit bewertet, als architektonische Eigenschaft** – ein Sicherheitsnetz mit offenen Gewichten *ist* eine solche Eigenschaft. Auch verknüpfenswert mit mozilla-state-of-open-source-ai-2026-07 und deanwball-open-weights-decelerationnistes-kimi-2026-07-17 zum Stellenwert offener Gewichte in der Sicherheitsdebatte.
- **Meta / der Satz, den man behalten sollte**: *„Mistral wird nicht entscheiden, was akzeptabel ist, es stellt das Werkzeug bereit, damit man selbst entscheidet.“* Das ist die Doktrin, in einem Satz – und die Notiz zeigt, dass sie einen Preis trägt, nicht nur eine Tugend.

## RésuméDe400mots

Eine Watch-Notiz vom **7. August 2026**, die **Shieldstral 1.0 3B** – den von **Mistral AI** am 4. August unter **Apache 2.0** veröffentlichten multimodalen Sicherheitsklassifikator – als die produktförmige Übersetzung einer politischen Haltung liest.

**Das Ausgangsparadox.** Am 13. Mai 2026 lehnte **Arthur Mensch** vor dem Untersuchungsausschuss der Nationalversammlung zu digitalen Verwundbarkeiten jede Aufsichtsrolle von Mistral über den Endgebrauch seiner Modelle ab: *„wir besitzen keine demokratische Legitimität“* – und wies dabei die Haltung von **Anthropic** zurück. Weniger als drei Monate später veröffentlicht Mistral ein Moderationsmodell. Der Autor löst den Widerspruch auf: **Shieldstral trägt keine Taxonomie des Erlaubten und des Verbotenen in sich** – es beantwortet eine vom Betreiber geschriebene Frage.

**Der Mechanismus.** Der Prompt gliedert sich in drei Teile: Kontext und Schweregrad, **eine einzige geschlossene Frage**, der zu beurteilende Inhalt. Das Modell antwortet mit `yes` oder `no`, und der **Softmax über diese beiden Tokens** liefert einen kontinuierlichen Score. **Die Richtlinie ist damit nicht erlernt**: Während **Llama Guard 4** die zur Trainingszeit fixierte MLCommons-Taxonomie einbettet, liest Shieldstral die eigene Richtlinie in natürlicher Sprache **zur Inferenzzeit**, änderbar ohne erneutes Training. Der technische Bericht (arXiv, 28. Juli) beziffert diese Entscheidung: **61,1 %** F1 bei der Anpassungsfähigkeit allein mit öffentlichen Datensätzen, **+23,3 Punkte** dank **4,4 Millionen kontrastiver Paare**, von einem LLM generiert, **91,3 %** nach Zusammenführung von drei Checkpoints. Das Objekt ist auf lokalen Betrieb zugeschnitten: **3,8 Mrd. Parameter**, Basis **Ministral 3** und Vision-Encoder **Pixtral**, **12 Sprachen**, **16 GB VRAM**. Bei Text: **84,9 %** durchschnittlicher F1 – auf Augenhöhe mit **GPT-OSS-Safeguard-20B**, siebenmal größer. Vom Autor geäußerter Vorbehalt: **die eigenen Zahlen des Anbieters, auf eigenen Testdatensätzen des Anbieters, ohne unabhängige Bewertung**.

**Die These.** Zwei Orte, um das Sicherheitsnetz unterzubringen. Bei **Anthropic** (9. Juni) wohnt es **in den Gewichten**, und der Anbieter entscheidet, wer davon ausgenommen wird – **Claude Fable 5** öffentlich, **Claude Mythos 5** vorbehalten den Cyberverteidigern des **Project Glasswing**. Bei Mistral liegt es **außerhalb des Modells**: eine separate, offene, selbst hostbare Komponente. Eine Entscheidung, die auf souveräne und Bankkunden ausgerichtet ist, und auf eine Souveränität, die **Abhängigkeit für Abhängigkeit** bewertet wird.

**Der Rückschlag.** Drei dokumentierte Lücken: **Auditierbarkeit** (binäre Ausgabe, keine Begründungsspur, während der Betreiber die Beweislast im Rahmen eines AI-Act-Audits trägt), **Robustheit** (Voltaires *Traktat über die Toleranz* als „Aufruf zur Gewalt“ eingestuft – eine Verwechslung von Erwähnung und Befürwortung), **Verfügbarkeit** (weder ein kostenpflichtiger Endpunkt noch ein offizieller Ollama-Eintrag, Stand 6. August). Daraus folgen drei Regeln: **zwei** Schwellenwerte auf einem hauseigenen Datensatz kalibrieren, **die aktive Richtlinienfrage protokollieren**, Erwähnung/Befürwortung und die eigenen Sprachen testen – und einen separaten **Prompt-Injection**-Detektor beibehalten. *„Apache 2.0, 16 GB VRAM, und die Verantwortung wird mit den Gewichten mitgeliefert.“*

## GrapheDeConnaissance

- Mistral AI —publie→ Shieldstral (TECHNOLOGIE, 0.98)
- Didier Girard —affirme_que→ Shieldstral met en production la doctrine défendue par Arthur Mensch devant la commission d'enquête de l'Assemblée nationale (AFFIRMATION, 0.96)
- Arthur Mensch —affirme_que→ un éditeur de modèles n'a pas la légitimité démocratique pour arbitrer l'usage final de ses modèles (CITATION, 0.96)
- Shieldstral —permet→ de lire une politique de modération en langage naturel au moment de l'inférence, sans réentraînement (AFFIRMATION, 0.96)
- Shieldstral —utilise→ une softmax sur les deux tokens yes et no pour produire un score continu entre 0 et 1 (AFFIRMATION, 0.94)
- Shieldstral —est_basé_sur→ Ministral 3 (TECHNOLOGIE, 0.94)
- Shieldstral —utilise→ Pixtral (TECHNOLOGIE, 0.92)
- Shieldstral —s_oppose_à→ Llama Guard 4 (TECHNOLOGIE, 0.92)
- Llama Guard 4 —utilise→ une taxonomie MLCommons figée à l'entraînement (AFFIRMATION, 0.93)
- Mistral AI —mesure→ 91,3 % de F1 en adaptabilité aux politiques, contre 61,1 % pour un fine-tuning sur jeux de données publics seuls (MESURE, 0.93)
- paire contrastive —améliore→ l'adaptabilité d'un classificateur à une politique fournie à l'inférence, de 23,3 points de F1 (MESURE, 0.91)
- Shieldstral —surpasse→ Qwen3Guard (TECHNOLOGIE, 0.85)
- Shieldstral —mesure→ 84,9 % de F1 moyen sur le texte, à égalité avec GPT-OSS-Safeguard-20B pourtant sept fois plus gros (MESURE, 0.88)
- Didier Girard —affirme_que→ tous les chiffres publiés viennent de Mistral, sur des jeux de test sélectionnés par Mistral, sans aucune évaluation tierce au 6 août 2026 (AFFIRMATION, 0.95)
- Anthropic —publie→ Claude Mythos 5 (TECHNOLOGIE, 0.95)
- Anthropic —s_oppose_à→ l'idée que le déployeur définisse lui-même la politique de sûreté, en logeant le garde-fou dans les poids et en arbitrant qui y échappe (AFFIRMATION, 0.9)
- topologie du garde-fou —s_applique_à→ le choix d'architecture entre une sûreté logée dans les poids et une sûreté déportée dans un composant séparé (AFFIRMATION, 0.92)
- Shieldstral —permet→ un filtre de modération auto-hébergeable dont la politique reste sur site, documenté au regard de l'AI Act (AFFIRMATION, 0.91)
- Shieldstral —s_applique_à→ des secteurs régaliens et régulés : ministère des Armées, BNP Paribas, administrations françaises et luxembourgeoise (AFFIRMATION, 0.86)
- Didier Girard —affirme_que→ le transfert de responsabilité vers le déployeur arrive sans son outillage : auditabilité, robustesse et disponibilité manquent (AFFIRMATION, 0.95)
- Shieldstral —s_oppose_à→ l'auditabilité d'une décision de modération, en ne produisant aucune trace de raisonnement (AFFIRMATION, 0.9)
- Shieldstral —observé_dans→ un faux positif sur le premier chapitre du Traité sur la tolérance de Voltaire, classé comme appelant à la violence (AFFIRMATION, 0.88)
- Didier Girard —recommande→ calibrer deux seuils sur un jeu étiqueté maison — auto-approbation, revue humaine, auto-rejet — plutôt que d'accepter le 0,5 par défaut (AFFIRMATION, 0.95)
- Didier Girard —recommande→ journaliser la question de politique active à chaque décision, puisqu'elle tiendra lieu de justification en audit (AFFIRMATION, 0.94)
- Didier Girard —affirme_que→ Shieldstral filtre du contenu et ne protège pas un agent contre un document piégé : garder un détecteur dédié à l'injection de prompt (AFFIRMATION, 0.95)
- Jonathan Kemper —mesure→ Shieldstral égale des modèles de sûreté bien plus gros sur le texte (AFFIRMATION, 0.85)

---
Canonical: https://www.thekb.eu/de/fiches/girard-shieldstral-mistral-doctrine-garde-fou-2026-08-07/
