Vai al contenuto

root / tags / cout-par-token

#coût par token

3 fiches

Strumenti e Piattaforme Traduzione verificata automaticamente

ZML/LLMD : et si le « Docker des LLM » était français ?

Analisi SFEIR (voce da società di consulenza) del lancio, l'8 luglio 2026, di **LLMD** da parte della startup parigina **ZML** (fondata da **Steeve Morin**, ex VP Engineering di Zenly): un server di inferenza che esegue LLM su **cinque famiglie di chip** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **a partire da un'unica codebase**. Tesi strutturante: il training sta cedendo il centro della scena all'**inferenza**, dove si decidono ormai il costo per token, la latenza e soprattutto la **dipendenza dal silicio**. La scommessa di ZML — riassunta dal motto *model to metal* — consiste nel **disaccoppiare il modello dall'hardware** tramite un compilatore scritto in **Zig + MLIR** che produce un binario nativo ermetico, senza Python nel percorso di esecuzione, esposto tramite una **API compatibile con OpenAI**. Due componenti, due licenze: **ZML** (il framework, Apache-2.0, >90% Zig) è open source; **LLMD** (il server) non lo è, gratuito al lancio. L'articolo legge l'oggetto attraverso tre lenti da società di consulenza — **FinOps dei token**, **libertà architetturale** (Design to Exit), **sovranità** (chip europei emergenti, integrazione nel processore VSORA Jotunn8) — per poi emettere un verdetto senza sconti: si tratta di un'**alpha**, da mettere "sotto osservazione attiva", non da adottare oggi.

#Inferenza LLM#serving#ZML

SFEIR (voix éditoriale du cabinet)

Economia e Mercato Traduzione verificata automaticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annuncio di benchmark da **Artificial Analysis** (piattaforma indipendente di valutazione di modelli AI, via X/Twitter + pagina del modello): **GLM-5.2** di **Z.ai** (Zhipu AI, @Zai_org) diventa **il modello open weights leader** e sale al **#3 posto nella classifica generale** di **GDPval-AA**, un benchmark basato su casi reali per il *lavoro intellettuale economicamente rilevante* (compiti agentic, multi-turno, a lungo orizzonte). GLM-5.2 ottiene **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 (xhigh, 1509)**. Precede con largo margine il miglior modello open successivo (**MiniMax-M3, 1408**), insieme a numerosi modelli proprietari: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. I compiti sono autenticamente agentic: **~31 turni per compito** in media su **1.999 confronti**. La stessa classifica si conferma sull'**Artificial Analysis Intelligence Index** (1° tra i modelli open weights), sull'**Agentic Index** (#3) e su **AA-Briefcase** (#3, davanti a GPT-5.5 xhigh, dietro solo a Fable 5). Da segnalare: un modello **open weights** con licenza **MIT**, **MoE con 753 miliardi di parametri / 40 miliardi attivi**, **contesto di 1M token**, con un prezzo di **1,40$/4,40$ per 1M di token** in input/output, che rivaleggia con la frontiera proprietaria sul lavoro agentic — un vero passo avanti per i modelli open.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)