# sfeir-zml-llmd-docker-llm-inference-souveraine-2026-07-09

## Veille

Análisis de SFEIR (voz de consultora) del lanzamiento, el 8 de julio de 2026, de **LLMD** por la startup parisina **ZML** (fundada por **Steeve Morin**, ex VP Engineering de Zenly): un servidor de inferencia que ejecuta LLMs en **cinco familias de chips** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **a partir de una única base de código**. Tesis estructurante: el entrenamiento está cediendo el protagonismo a la **inferencia**, donde ahora se deciden el coste por token, la latencia y, sobre todo, la **dependencia del silicio**. La apuesta de ZML —resumida en el lema *model to metal*— consiste en **desacoplar el modelo del hardware** mediante un compilador escrito en **Zig + MLIR** que produce un binario nativo hermético, sin Python en la ruta de ejecución, expuesto a través de una **API compatible con OpenAI**. Dos componentes, dos licencias: **ZML** (el framework, Apache-2.0, >90% Zig) es de código abierto; **LLMD** (el servidor) no lo es, gratuito en el lanzamiento. El artículo lee el objeto a través de tres prismas propios de consultora —**FinOps de tokens**, **libertad arquitectónica** (Design to Exit), **soberanía** (chips europeos emergentes, integración en el procesador Jotunn8 de VSORA)— y ofrece después un veredicto sin concesiones: se trata de una **alfa**, que hay que situar "bajo vigilancia activa", no para adoptar hoy.

## Titre Article

ZML/LLMD : et si le « Docker des LLM » était français ?

## Date

2026-07-09

## URL

https://www.sfeir.com/articles/zml-llmd-docker-llms-inference-souveraine/

## Keywords

Inferencia de LLM, serving, ZML, LLMD, Steeve Morin, model to metal, Docker para LLMs, desacoplamiento modelo-hardware, portable, no nivelado, Zig, MLIR, compilación AOT, binario nativo hermético, API compatible con OpenAI, continuous batching, paged attention, prefix caching, tool calling, DFlash, decodificación especulativa, zero-copy, Hugging Face, NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal, arranque en frío, FinOps de IA, coste por token, coste por resultado, libertad arquitectónica, Design to Exit, reversibilidad, lock-in, soberanía, chips europeos, Axelera, Kalray, SiPearl, VSORA, Jotunn8, Scaleway, Región de Île-de-France, VivaTech 2026, Yann LeCun, Solomon Hykes, Clément Delangue, Julien Chaumond, Xavier Niel, vLLM, llama.cpp, vista previa técnica, DGX Spark, Ryzen AI Max+ 395, Apple Silicon, soberanía del hardware

## Authors

SFEIR (voix éditoriale du cabinet)

## Ton

**Perfil**: análisis tecnológico de consultora (thought leadership de SFEIR), dirigido a CIOs, arquitectos y responsables de decisión en infraestructura. Registro pedagógico y estructurado ("En resumen", capas de la pila, "Puntos clave"), alta tecnicidad pero accesible, longitud media (~1800 palabras). Postura claramente situada: la firma se dirige a sus clientes y vincula el objeto con su oferta (FinOps de tokens, multi-nube/multi-hardware, Design to Exit).

**Estilo**: recurre a la **metáfora de Docker** ("el *docker run* de la inferencia: un modelo, un comando, cualquier chip") sin dejarse engañar por ella —la anécdota del inversor Solomon Hykes sirve a la figura—. Un equilibrio reivindicado entre entusiasmo y cautela: cada promesa del proveedor va **acompañada de una advertencia** ("estas cifras siguen siendo afirmaciones del proveedor, a la espera de mediciones independientes"; la ganancia anunciada de DFlash "hasta 10×" se recontextualiza frente al "~6,17×" de la investigación subyacente). La sección "El veredicto, sin concesiones" adopta la postura de un analista: distingue *vista previa técnica* de producción, nombra lo que el proveedor deja **sin mencionar ni someter a benchmark** (DGX Spark, Ryzen AI Max+). Anclaje sistemático de la casa: remite a artículos de SFEIR sobre arquitectura multi-LLM soberana y la elección multi-nube vs. soberano, y al caso cliente de France Télévisions (plataforma ALIX). Citación de fuentes explícita y numerada (zml.ai, TechCrunch, X, arXiv, GlobeNewswire).

## Pense-betes

- **Idea central: la inferencia es el nuevo cuello de botella.** Tras dos años centrados en el tamaño de los modelos y el coste del entrenamiento, el despliegue en producción desplaza el foco: lo que importa en el día a día es el **coste por token servido**, la latencia percibida y la **dependencia de un único proveedor de silicio**. El serving se convierte en "tanto la factura de la nube como el margen de maniobra estratégico".
- **La apuesta de ZML: *model to metal*, desacoplar el modelo del hardware.** No un modelo más, sino una capa de abstracción. La pila tiene **cuatro capas**: (1) modelos (Qwen, Gemma, Mistral, LLaMa) cargados de forma **zero-copy** mediante un FS virtual desde HF/S3/GCS, sin descarga local; (2) **LLMD**, un servidor que expone una **API compatible con OpenAI** (drop-in) con continuous batching, paged attention, prefix caching, tool calling, métricas Prometheus; (3) **ZML**, un compilador **AOT** (Zig + MLIR) hacia un **binario nativo hermético**, sin Python en la ruta de ejecución; (4) ejecución en **5 backends**: NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal.
- **Una elección de diseño decisiva: "portable, no nivelado".** En lugar de reducir todos los aceleradores a un mínimo común denominador, ZML **conserva las rutas específicas de cada chip** (FlashAttention en NVIDIA, kernels AITER en AMD). Esto es lo que distingue una abstracción útil de un suelo de rendimiento.
- **Cifras anunciadas (afirmaciones del proveedor, a verificar).** Imágenes de contenedor muy compactas: ~**1,7 GB** (CUDA), **280 MB** (TPU), **~140 MB** (build Apple). **Arranque en frío** del orden de **1 a 2 s** en un modelo de 8B. La firma insiste: "a la espera de mediciones independientes".
- **DFlash — decodificación especulativa integrada.** ZML reivindica "hasta **10×**"; la investigación subyacente (arXiv:2602.06036, *block diffusion for flash speculative decoding*) reporta en cambio **~6,17×** en Qwen3-8B. Un matiz que conviene mantener presente ante una audiencia técnica.
- **La demo en dos comandos (Mac con Apple Silicon).** `brew install zml/zml/llmd` y después `llmd --model=hf://Qwen/Qwen3.6-27B` → un servidor local con una API OpenAI, consultable vía `curl localhost:8000/v1/chat/completions`. Todo el valor de la compatibilidad con OpenAI: los scripts/bibliotecas se reconectan **sin reescritura**. Dos advertencias: la primera solicitud es más lenta (compilación del grafo); un **modelo de 27B en BF16** requiere **≥ 64 GB de memoria unificada**.
- **Dos componentes, dos licencias (a tener en cuenta antes de construir encima).** **ZML** = framework de código abierto (Apache-2.0, Zig). **LLMD** = servidor **no de código abierto**, gratuito en el lanzamiento mientras se **recopilan datos de uso** de cara a una futura monetización.
- **Tres apuestas propias de consultora.** (1) **Económica / FinOps**: desacoplar la carga de trabajo del silicio = el derecho a elegir el chip más barato o más disponible → actuar sobre el coste por token (una lógica de "coste por resultado"). (2) **Libertad arquitectónica**: alejarse de "una base de código por objetivo de hardware" reduce la deuda técnica y el coste de migración, y preserva el **poder de negociación** —esto es **Design to Exit** (pagar por adelantado la capa que hace que el proveedor sea reemplazable), extendido hasta el nivel del chip; un paralelismo con el caso de la **plataforma France Télévisions / ALIX**. (3) **Soberanía**: ZML se posiciona como facilitador de **chips europeos emergentes** (Axelera, Kalray, SiPearl, VSORA).
- **Un anclaje de soberanía concreto: VivaTech 2026.** Una alianza **ZML × Scaleway × VSORA × Región de Île-de-France** en torno a una cadena de valor de inferencia soberana (desde el silicio hasta la operación), con la capa ZML integrada en el procesador **VSORA Jotunn8**.
- **Credibilidad a través de la financiación.** Fundada en París en 2023, ~20 personas, ~**20 millones de dólares** recaudados (20VC, Kima Ventures/Xavier Niel, Kindred Capital, LocalGlobe, Puzzle Ventures). Business angels destacados: **Solomon Hykes** (creador de Docker —un guiño a la metáfora—), **Clément Delangue** y **Julien Chaumond** (Hugging Face), y **Yann LeCun** (Turing), que la respalda públicamente.
- **Veredicto sin concesiones.** LLMD es una **vista previa técnica**: no apta para producción, con un catálogo de modelos en expansión. Sobre todo, el soporte de las máquinas locales que todos tienen en mente (**DGX Spark** ARM64+Blackwell, **Ryzen AI Max+ 395**, Macs recientes) **puede inferirse** a partir de los backends, pero **no se menciona ni se somete a benchmark** —"a verificar uno mismo". Posicionamiento competitivo: **vLLM** sigue siendo la referencia en rendimiento en GPUs de servidor (aunque el soporte de Apple Silicon es comunitario/experimental); **llama.cpp** sigue siendo el rey del uso local individual; LLMD apunta a un término medio —"un vLLM que se instala en un Mac". Recomendación: **no adoptar, situar bajo vigilancia activa**.
- **Para referencia cruzada**: la familia "soberanía / multi-nube vs. soberano" y "arquitectura multi-LLM soberana" (artículos de SFEIR); el FinOps de la IA generativa y el coste por resultado (nota de Didier Girard sobre AI4IT vs AI4Business); Steeve Morin ya presente en el corpus (presentador del podcast "À la French").

## RésuméDe400mots

El 8 de julio de 2026, la startup parisina **ZML** lanzó **LLMD**, un servidor de inferencia que ejecuta grandes modelos de lenguaje en **cinco familias de chips** (NVIDIA, AMD, Google, Intel, Apple) a partir de **una única base de código**. SFEIR interpreta esto como una señal: a medida que el entrenamiento cede el protagonismo a la **inferencia**, el verdadero campo de batalla —y centro de coste— se desplaza hacia el **serving**, donde se deciden el coste por token, la latencia y la dependencia del silicio.

La apuesta de ZML se resume en tres palabras, *model to metal*: no ofrecer un modelo más, sino una capa que **desacopla el modelo del hardware**. La pila tiene cuatro capas. En la parte superior, los modelos (Qwen, Gemma, Mistral, LLaMa) cargados de forma **zero-copy** mediante un sistema de archivos virtual desde Hugging Face, S3 o GCS. Después, **LLMD**, un servidor que expone una **API compatible con OpenAI** (drop-in) con continuous batching, paged attention, prefix caching, tool calling y métricas Prometheus. Por debajo, **ZML** compila el grafo **de antemano, de una vez por todas**, en un **binario nativo hermético** en **Zig + MLIR**, sin Python en la ruta de ejecución. Este binario se ejecuta en cinco backends: CUDA, ROCm, TPU, oneAPI, Metal. La elegancia reside en ser "portable, no nivelado" —las rutas específicas de cada chip (FlashAttention, AITER) se conservan—. Cifras anunciadas (por el proveedor): imágenes de 1,7 GB (CUDA) a ~140 MB (Apple), arranque en frío de 1-2 s en un modelo de 8B, y el acelerador **DFlash** (que reivindica "hasta 10×", ~6,17× en la investigación subyacente).

Dos componentes, dos licencias: **ZML** (el framework) es de código abierto (Apache-2.0, >90% Zig); **LLMD** (el servidor) no lo es, gratuito en el lanzamiento mientras se recopilan datos de uso. La demo se ejecuta en dos comandos en Macs con Apple Silicon; un modelo de 27B en BF16 requiere ≥ 64 GB de memoria unificada.

SFEIR interpreta el objeto a través de tres prismas orientados al cliente: **FinOps** (elegir el chip más barato → actuar sobre el coste por token), **libertad arquitectónica** (**Design to Exit**, reversibilidad integrada, cf. France Télévisions/ALIX) y **soberanía** (chips europeos Axelera, Kalray, SiPearl, VSORA; una alianza en VivaTech 2026 con Scaleway, VSORA y la Región de Île-de-France, integración en el procesador Jotunn8).

Veredicto sin concesiones: se trata de una **alfa**, no apta para producción; el soporte de máquinas locales específicas (DGX Spark, Ryzen AI Max+) no se menciona ni se somete a benchmark. Frente a vLLM (rendimiento en servidor GPU) y llama.cpp (uso local individual), LLMD apunta a un término medio. No para adoptar hoy, sino para situar "bajo vigilancia activa": un candidato serio, *made in France*, a convertirse en el "*docker run* de la inferencia".

## GrapheDeConnaissance

- ZML —publie→ LLMD (TECHNOLOGIE, 0.98)
- Steeve Morin —dirige→ ZML (ORGANISATION, 0.95)
- LLMD —permet→ inférence LLM sur cinq familles de puces depuis une seule base de code (AFFIRMATION, 0.95)
- LLMD —utilise→ ZML (TECHNOLOGIE, 0.95)
- ZML —utilise→ Zig (TECHNOLOGIE, 0.95)
- ZML —utilise→ MLIR (TECHNOLOGIE, 0.9)
- LLMD —utilise→ API compatible OpenAI (CONCEPT, 0.95)
- LLMD —utilise→ DFlash (TECHNOLOGIE, 0.9)
- DFlash —améliore→ vitesse de décodage jusqu'à ~6,17× sur Qwen3-8B (MESURE, 0.8)
- model to metal —réduit→ dépendance à un unique fournisseur de silicium (CONCEPT, 0.9)
- LLMD —s_applique_à→ FinOps de l'IA générative (METHODOLOGIE, 0.85)
- LLMD —s_applique_à→ Design to Exit (METHODOLOGIE, 0.85)
- ZML —collabore_avec→ Scaleway (ORGANISATION, 0.9)
- ZML —collabore_avec→ VSORA (ORGANISATION, 0.9)
- ZML —fait_partie_de→ Jotunn8 (TECHNOLOGIE, 0.85)
- Yann LeCun —soutient→ ZML (ORGANISATION, 0.9)
- Solomon Hykes —a_créé→ Docker (TECHNOLOGIE, 0.97)
- LLMD —concurrence→ vLLM (TECHNOLOGIE, 0.85)
- LLMD —concurrence→ llama.cpp (TECHNOLOGIE, 0.85)
- ZML —est_variante_de→ Apache-2.0 (open source) (CONCEPT, 0.9)
- SFEIR —recommande→ mettre LLMD sous surveillance active plutôt que basculer en production aujourd'hui (AFFIRMATION, 0.92)

---
Canonical: https://www.thekb.eu/es/fiches/sfeir-zml-llmd-docker-llm-inference-souveraine-2026-07-09/
