# google-genie-3-video-generation-model-deepmind-2025-08-05

## Veille

Google DeepMind Genie 3 — modelo de generación de vídeo interactivo: modelos de mundo, generación controlable, juegos jugables generados por IA (deepmind.google)

## Titre Article

Google DeepMind Unveils Genie 3: Revolutionary Interactive Video Generation Model

## Date

2025-08-05

## URL

https://deepmind.google/discover/blog/

## Keywords

Google, Genie 3, DeepMind, generación de vídeo, IA generativa, modelos de mundo, vídeo interactivo, generación controlable, generación de juegos, comprensión espacial, coherencia temporal, juegos generados por IA

## Authors

Google DeepMind team

## Ton

**Perfil:** Investigación-Innovación | Institucional de investigación | Informativo-Inspiracional | Experto

El equipo de DeepMind adopta una voz de anuncio de investigación que presenta un avance en la generación de vídeo interactivo. El posicionamiento de Genie 3 enfatiza las capacidades de modelos de mundo y generación controlable. El lenguaje especializado de investigación en IA (comprensión espacial, coherencia temporal, modelos generativos) demuestra sofisticación técnica. El tono de entusiasmo mesurado es típico de las comunicaciones de investigación de DeepMind, equilibrando el rigor científico con un mensaje de innovación. La estructura de demostración de capacidades revela el potencial del modelo. Típico de los anuncios de modelos importantes de los laboratorios de IA (estilo OpenAI, Anthropic Research), dirigido a la comunidad investigadora, los desarrolladores y los medios que cubren el progreso de la IA.

## Pense-betes

- **Genie 3**: el último modelo de generación de vídeo de Google
- **Vídeo interactivo controlable**: la entrada del usuario impulsa la generación
- **Capacidades de modelo de mundo**: comprensión de la física y las relaciones espaciales
- **Generación de juegos**: creación de experiencias interactivas jugables
- **Coherencia temporal**: consistencia mantenida a lo largo de los fotogramas
- **11.000 millones de parámetros**: escala masiva del modelo
- **Control basado en acciones**: responde a los comandos del usuario durante la generación
- **Enfoque de entrenamiento**: aprendizaje a partir de secuencias de videojuegos
- **Física emergente**: el modelo descubre las reglas físicas

## RésuméDe400mots

Google DeepMind anuncia **Genie 3**, un modelo revolucionario de **generación de vídeo interactivo** capaz de crear **vídeo controlable y temporalmente coherente** que responde a las acciones del usuario en tiempo real. A diferencia de los modelos de vídeo anteriores que producen secuencias fijas, **Genie 3 funciona como un modelo de mundo** — comprendiendo relaciones espaciales, física y causalidad — y permite **experiencias interactivas generadas por IA**, incluidos juegos jugables creados a partir de descripciones textuales o imágenes.

**Innovación central: generación controlable**

El avance fundamental es **el control del usuario durante la generación**. Genie 3 acepta entradas continuas — teclas de dirección, movimientos del ratón, comandos de acción — y genera vídeo que responde de forma apropiada. Ejemplo: el usuario solicita "un juego de plataformas en un bosque", Genie genera el primer fotograma, después el usuario **controla los movimientos del personaje**, y el modelo genera los fotogramas siguientes (saltos, desplazamiento, interacciones con el entorno). Este **bucle interactivo** crea experiencias jugables en lugar de vídeos pasivos.

**Arquitectura y entrenamiento del modelo de mundo**

Genie 3 implementa un **modelo de mundo latente**: una representación comprimida de la física de un entorno, comprensión de las relaciones espaciales y la permanencia de los objetos, predicción de las consecuencias de las acciones, coherencia temporal en secuencias extensas. El modelo **no ejecuta una física preprogramada**: aprendió las reglas físicas observando enormes volúmenes de secuencias de videojuegos (juegos de plataformas 2D como datos principales, anotaciones de acciones, estilos visuales variados), desarrollando una **comprensión emergente** de la gravedad, las colisiones y la dinámica del movimiento. Sus **11.000 millones de parámetros** le permiten captar relaciones de grano fino entre las acciones y sus consecuencias visuales.

**Coherencia temporal y aplicaciones**

Los modelos de vídeo tienen dificultades para mantener la apariencia, la posición y la física de los objetos a lo largo de los fotogramas. Genie 3 aborda este problema mediante mecanismos de memoria a largo plazo, a priori informados por la física, atención espacial y condicionamiento por acciones, con una coherencia notablemente mejorada. Aplicaciones: **prototipado rápido de juegos**, juegos educativos personalizados, accesibilidad, contenido procedural, herramientas creativas sin código — una **democratización del desarrollo de videojuegos**.

**Limitaciones y competencia**

Limitaciones reconocidas: un techo en la complejidad de las mecánicas, degradación de la coherencia en secuencias muy largas, fidelidad de control imperfecta, coste de inferencia elevado, sesgo de los datos de entrenamiento. Frente a **Runway Gen-3**, **OpenAI Sora** o Make-A-Video de Meta, el **control interactivo** de Genie 3 es el diferenciador clave, un paso hacia **modelos de mundo de propósito general**. A largo plazo, Genie 3 traza una trayectoria hacia simuladores de mundo de propósito general, experiencias interactivas impulsadas por IA más allá de los videojuegos, y mundos virtuales generados por IA que responden a la agencia del usuario.

## GrapheDeConnaissance

- Google DeepMind —publie→ Genie 3 (TECHNOLOGIE, 0.98)
- Genie 3 —est_basé_sur→ world model latent (CONCEPT, 0.95)
- Genie 3 —utilise→ 11 milliards de paramètres (CONCEPT, 0.92)
- Genie 3 —permet→ génération vidéo interactive contrôlable (CONCEPT, 0.97)
- Genie 3 —est_basé_sur→ vidéos de jeux vidéo platformer (CONCEPT, 0.9)
- Genie 3 —permet→ compréhension émergente de la physique (CONCEPT, 0.88)
- Genie 3 —améliore→ cohérence temporelle (CONCEPT, 0.93)
- Genie 3 —concurrence→ OpenAI Sora (TECHNOLOGIE, 0.85)
- Genie 3 —concurrence→ Runway Gen-3 (TECHNOLOGIE, 0.85)
- Genie 3 —permet→ prototypage rapide de jeux (CONCEPT, 0.87)
- world model latent —améliore→ développement de jeux vidéo (CONCEPT, 0.82)
- Google DeepMind —fait_partie_de→ Google DeepMind (ORGANISATION, 0.99)
- Genie 3 —utilise→ contrôle par actions (CONCEPT, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/google-genie-3-video-generation-model-deepmind-2025-08-05/
