Diffusion Language Models Explained: How Google's Diffusion Gemma Works
Artículo educativo del **MindStudio Team** (blog de la plataforma MindStudio, orquestación de flujos de trabajo multimodelo) que explica los **modèles de langage par diffusion** (*Diffusion Language Models*) a través del caso de **Diffusion Gemma**, la primera implementación de **open weights** de Google (2.000 millones de parámetros, derivada de Gemma 2). La tesis: mientras que los modelos **autoregressive** (GPT-4, Claude, Gemma estándar) generan texto **token a token, de izquierda a derecha** (atención **causal**, cada token fijado una vez producido), los modelos de **diffusion** parten de una secuencia **enmascarada/con ruido** y la **refinan iterativamente** (masked diffusion / *absorbing diffusion*), con **atención bidireccional**: el modelo puede **revisar cualquier posición en cualquier paso**. Consecuencias: alto **paralelismo** (un texto de 500 tokens requeriría 50-100 pasos de eliminación de ruido en lugar de 500 pasadas secuenciales), **infilling** natural y **generación restringida** (relleno de plantillas, completado de código con contexto circundante), y capacidad de **revisión** integrada. Pero a la escala actual (2B), Diffusion Gemma **no iguala** a los grandes modelos autoregresivos (GPT-4o, Gemini 1.5 Pro) en razonamiento, seguimiento de instrucciones y conocimiento general: la brecha se está "cerrando" sin estar cerrada. La inspiración proviene de la generación de imágenes (Stable Diffusion, DALL-E abandonaron la autorregresión hace años); si el mismo principio se sostiene para el texto sigue siendo una pregunta abierta. Diffusion Gemma se distribuye en Hugging Face (Google DeepMind), AI Studio y Vertex AI.
MindStudio Team