Aller au contenu

root / tags / cout-par-token

#coût par token

3 fiches

Outils & Plateformes

ZML/LLMD : et si le « Docker des LLM » était français ?

Décryptage SFEIR (voix cabinet) du lancement, le 8 juillet 2026, de **LLMD** par la startup parisienne **ZML** (fondée par **Steeve Morin**, ex-VP Engineering de Zenly) : un serveur d'inférence qui fait tourner les LLM sur **cinq familles de puces** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **depuis une seule base de code**. Thèse structurante : l'entraînement cède la vedette à l'**inférence**, où se jouent désormais le coût par token, la latence et surtout la **dépendance au silicium**. Le pari de ZML — résumé par la devise *model to metal* — est de **découpler le modèle du matériel** via un compilateur en **Zig + MLIR** produisant un binaire natif hermétique, sans Python dans le chemin d'exécution, exposé par une **API compatible OpenAI**. Deux briques, deux licences : **ZML** (framework, Apache-2.0, >90 % Zig) est open source ; **LLMD** (serveur) ne l'est pas, gratuit au lancement. L'article lit l'objet sous trois angles cabinet — **FinOps du token**, **liberté d'architecture** (Design to Exit), **souveraineté** (puces européennes émergentes, intégration dans le processeur VSORA Jotunn8) — puis livre un verdict sans complaisance : c'est une **alpha**, à mettre « sous surveillance active », pas à basculer aujourd'hui.

#Inférence LLM#serving#ZML

SFEIR (voix éditoriale du cabinet)

Économie & Marché

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annonce-benchmark d'**Artificial Analysis** (plateforme d'évaluation indépendante de modèles IA, via X/Twitter + page modèle) : **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) devient **le meilleur modèle à poids ouverts** et se hisse **#3 au classement général** de **GDPval-AA**, un benchmark de *travail de connaissance économiquement valorisable* du monde réel (tâches longue-horizon, multi-tours, agentiques). GLM-5.2 marque **1524 Elo**, derrière les seuls **Claude Fable 5 (1783)** et **Claude Opus 4.8 (1615)**, et à parité avec **GPT-5.5 (xhigh, 1509)**. Il devance d'une large marge le modèle ouvert suivant (**MiniMax-M3, 1408**) et de nombreux modèles propriétaires : **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Les tâches sont réellement agentiques : **~31 tours par tâche** en moyenne sur **1 999 matchs**. La même hiérarchie tient sur l'**Artificial Analysis Intelligence Index** (1er open weights), l'**Agentic Index** (#3) et **AA-Briefcase** (#3, devant GPT-5.5 xhigh, derrière Fable 5). Point saillant : un modèle **open weights** sous **licence MIT**, **MoE 753 Mds de paramètres / 40 Mds actifs**, contexte **1M tokens**, tarifé **1,40 $/4,40 $ par 1M tokens** entrée/sortie, rivalise avec la frontière propriétaire sur le travail agentique — un vrai pas pour les modèles ouverts.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)