Diffusion Language Models Explained: How Google's Diffusion Gemma Works
Articolo didattico del **MindStudio Team** (blog della piattaforma MindStudio, orchestrazione di workflow multi-modello) che spiega i **modèles de langage par diffusion** (*Diffusion Language Models*) attraverso il caso di **Diffusion Gemma**, la prima implementazione **open weights** di Google (2 miliardi di parametri, derivata da Gemma 2). La tesi: mentre i modelli **autoregressivi** (GPT-4, Claude, Gemma standard) generano testo **token per token, da sinistra a destra** (attenzione causale, ogni token fissato una volta prodotto), i modelli a **diffusione** partono da una sequenza **mascherata/rumorosa** e la **raffinano iterativamente** (masked diffusion / *absorbing diffusion*), con **attenzione bidirezionale**: il modello può **rivedere qualsiasi posizione in qualsiasi passo**. Conseguenze: elevato **parallelismo** (un testo di 500 token richiederebbe 50-100 passi di denoising invece di 500 passaggi sequenziali), **infilling** naturale e **generazione vincolata** (compilazione di template, completamento di codice con contesto circostante), e capacità di **revisione** integrata. Ma alla scala attuale (2B), Diffusion Gemma **non eguaglia** i grandi modelli autoregressivi (GPT-4o, Gemini 1.5 Pro) su ragionamento, seguimento delle istruzioni e conoscenza generale: il divario si sta "colmando" senza essere colmato. L'ispirazione viene dalla generazione di immagini (Stable Diffusion, DALL-E hanno abbandonato l'autoregressione anni fa); se lo stesso principio valga anche per il testo resta una domanda aperta. Diffusion Gemma è distribuito su Hugging Face (Google DeepMind), AI Studio e Vertex AI.
MindStudio Team