Una nota de vigilancia del 7 de agosto de 2026 que lee Shieldstral 1.0 3B — el clasificador de seguridad multimodal publicado por Mistral AI el 4 de agosto bajo Apache 2.0 — como la traducción en forma de producto de una postura política.

La paradoja de partida. El 13 de mayo de 2026, ante la comisión de investigación de la Asamblea Nacional sobre las vulnerabilidades digitales, Arthur Mensch rechazó cualquier papel de supervisión de Mistral sobre el uso final de sus modelos: "no tenemos legitimidad democrática", descartando de paso la postura de Anthropic. Menos de tres meses después, Mistral lanza un modelo de moderación. El autor disuelve la contradicción: Shieldstral no incorpora ninguna taxonomía de lo lícito y lo ilícito — responde a una pregunta que escribe quien lo despliega.

llamada a la violencia

**Didier Girard** — auteur de la note , x.com

El mecanismo. El prompt cabe en tres partes: contexto y severidad, una única pregunta cerrada, el contenido a juzgar. El modelo responde yes o no y el softmax sobre estos dos tokens da una puntuación continua. La política, por tanto, no se aprende: mientras que Llama Guard 4 incorpora la taxonomía de MLCommons fijada en el entrenamiento, Shieldstral lee la vuestra en lenguaje natural en el momento de la inferencia, modificable sin reentrenamiento. El informe técnico (arXiv, 28 de julio) cuantifica esta elección: 61,1% de F1 en adaptabilidad solo con conjuntos de datos públicos, +23,3 puntos gracias a 4,4 millones de pares contrastivos generados por un LLM, 91,3% tras la fusión de tres checkpoints. El objeto está dimensionado para funcionar on-premises: 3.800 millones de parámetros, base Ministral 3 y codificador de visión Pixtral, 12 idiomas, 16 GB de VRAM. En texto, 84,9% de F1 promedio — a la par de GPT-OSS-Safeguard-20B, siete veces más grande. Salvedad planteada por el autor: las propias cifras del proveedor, sobre los propios conjuntos de prueba del proveedor, sin evaluación de terceros.

La tesis. Dos lugares posibles para alojar la barrera de seguridad. En Anthropic (9 de junio), vive en los pesos y el editor arbitra quién queda exento de ella — Claude Fable 5 público, Claude Mythos 5 reservado a los ciberdefensores de Project Glasswing. En Mistral, se sitúa fuera del modelo: un componente separado, abierto, autoalojable. Una elección alineada con clientes soberanos y bancarios, y con una soberanía que se cualifica dependencia por dependencia.

El contratiempo. Tres carencias documentadas: auditabilidad (salida binaria, sin traza de razonamiento, mientras que quien despliega soporta la carga de la justificación en una auditoría de la AI Act), robustez (el Tratado sobre la tolerancia de Voltaire clasificado como «llamada a la violencia» — una confusión entre mención y respaldo), disponibilidad (ni endpoint facturado ni listado oficial en Ollama a fecha del 6 de agosto). De ahí tres reglas: calibrar dos umbrales sobre un conjunto de datos propio, registrar la pregunta de política activa, probar mención/respaldo y vuestros idiomas — y mantener un detector de prompt-injection separado. "Apache 2.0, 16 GB de VRAM, y la responsabilidad enviada junto con los pesos."