# google-genie-3-video-generation-model-deepmind-2025-08-05

## Veille

Google DeepMind Genie 3 — interaktives Videogenerierungsmodell: Weltmodelle, steuerbare Generierung, spielbare KI-generierte Spiele (deepmind.google)

## Titre Article

Google DeepMind Unveils Genie 3: Revolutionary Interactive Video Generation Model

## Date

2025-08-05

## URL

https://deepmind.google/discover/blog/

## Keywords

Google, Genie 3, DeepMind, Videogenerierung, generative KI, Weltmodelle, interaktives Video, steuerbare Generierung, Spielgenerierung, räumliches Verständnis, zeitliche Kohärenz, KI-generierte Spiele

## Authors

Google DeepMind team

## Ton

**Profil:** Forschung-Innovation | Institutionelle Forschung | Informativ-Inspirierend | Experte

Das DeepMind-Team wählt einen Ton der Forschungsankündigung, der einen Durchbruch in der interaktiven Videogenerierung vorstellt. Die Positionierung von Genie 3 betont Weltmodelle und Fähigkeiten zur steuerbaren Generierung. Die spezialisierte KI-Forschungssprache (räumliches Verständnis, zeitliche Kohärenz, generative Modelle) demonstriert technische Kompetenz. Der Ton gemäßigter Begeisterung ist typisch für DeepMind-Forschungskommunikation und balanciert wissenschaftliche Genauigkeit mit einer Innovationsbotschaft. Die Struktur der Fähigkeitsdemonstration zeigt das Potenzial des Modells. Typisch für Ankündigungen großer Modelle von KI-Labors (im Stil von OpenAI, Anthropic Research), gerichtet an die Forschungsgemeinschaft, Entwickler und Medien, die über KI-Fortschritte berichten.

## Pense-betes

- **Genie 3**: neuestes Videogenerierungsmodell von Google
- **Steuerbares interaktives Video**: Nutzereingaben steuern die Generierung
- **Fähigkeiten als Weltmodell**: Verständnis von Physik und räumlichen Beziehungen
- **Spielgenerierung**: Erzeugung spielbarer interaktiver Erlebnisse
- **Zeitliche Kohärenz**: Konsistenz über Einzelbilder hinweg beibehalten
- **11 Milliarden Parameter**: massiver Modellumfang
- **Aktionsbasierte Steuerung**: reagiert während der Generierung auf Nutzerbefehle
- **Trainingsansatz**: Lernen aus Videospielsequenzen
- **Emergente Physik**: das Modell entdeckt physikalische Regeln selbst

## RésuméDe400mots

Google DeepMind kündigt **Genie 3** an, ein revolutionäres Modell zur **interaktiven Videogenerierung**, das **steuerbares, zeitlich kohärentes Video** erzeugen kann, das in Echtzeit auf Nutzeraktionen reagiert. Anders als frühere Videomodelle, die feste Sequenzen erzeugen, **fungiert Genie 3 als Weltmodell** — es versteht räumliche Beziehungen, Physik und Kausalität — und ermöglicht **KI-generierte interaktive Erlebnisse**, einschließlich spielbarer Spiele, die aus Textbeschreibungen oder Bildern erzeugt werden.

**Kerninnovation: steuerbare Generierung**

Der grundlegende Fortschritt ist die **Nutzersteuerung während der Generierung**. Genie 3 verarbeitet kontinuierliche Eingaben — Pfeiltasten, Mausbewegungen, Aktionsbefehle — und erzeugt Video, das entsprechend reagiert. Beispiel: Der Nutzer fordert „ein Plattformspiel im Wald“ an, Genie erzeugt das erste Einzelbild, dann **steuert der Nutzer die Bewegungen der Figur**, wobei das Modell die nachfolgenden Einzelbilder generiert (Sprünge, Bewegung, Interaktionen mit der Umgebung). Diese **interaktive Schleife** schafft spielbare Erlebnisse statt passiver Videos.

**Architektur und Training des Weltmodells**

Genie 3 implementiert ein **latentes Weltmodell**: eine komprimierte Repräsentation der Physik einer Umgebung, Verständnis räumlicher Beziehungen und Objektpermanenz, Vorhersage der Konsequenzen von Aktionen, zeitliche Kohärenz über längere Sequenzen. Das Modell **führt keine vorprogrammierte Physik aus**: Es hat physikalische Regeln durch die Beobachtung riesiger Mengen von Videospielsequenzen gelernt (2D-Plattformspiele als primäre Daten, Aktionsannotationen, vielfältige visuelle Stile) und dabei ein **emergentes Verständnis** von Gravitation, Kollisionen und Bewegungsdynamik entwickelt. Seine **11 Milliarden Parameter** erlauben es, feingranulare Beziehungen zwischen Aktionen und visuellen Konsequenzen zu erfassen.

**Zeitliche Kohärenz und Anwendungen**

Videomodelle haben Schwierigkeiten, das Erscheinungsbild, die Position und die Physik von Objekten über Einzelbilder hinweg beizubehalten. Genie 3 adressiert dies durch Langzeitgedächtnismechanismen, physikinformierte Priors, räumliche Aufmerksamkeit und Aktionskonditionierung, mit deutlich verbesserter Kohärenz. Anwendungen: **schnelles Spiele-Prototyping**, maßgeschneiderte Lernspiele, Barrierefreiheit, prozedurale Inhalte, No-Code-Kreativtools — eine **Demokratisierung der Spieleentwicklung**.

**Grenzen und Wettbewerb**

Anerkannte Grenzen: eine Obergrenze bei der Komplexität der Mechaniken, nachlassende Kohärenz bei sehr langen Sequenzen, unvollkommene Steuerungstreue, hohe Inferenzkosten, Verzerrung durch die Trainingsdaten. Im Vergleich zu **Runway Gen-3**, **OpenAI Sora** oder Metas Make-A-Video ist die **interaktive Steuerung** von Genie 3 das entscheidende Unterscheidungsmerkmal, ein Schritt hin zu **universellen Weltmodellen**. Langfristig zeichnet Genie 3 eine Entwicklung hin zu universellen Weltsimulatoren, KI-gesteuerten interaktiven Erlebnissen jenseits des Gamings und KI-generierten virtuellen Welten nach, die auf die Handlungsfähigkeit der Nutzer reagieren.

## GrapheDeConnaissance

- Google DeepMind —publie→ Genie 3 (TECHNOLOGIE, 0.98)
- Genie 3 —est_basé_sur→ world model latent (CONCEPT, 0.95)
- Genie 3 —utilise→ 11 milliards de paramètres (CONCEPT, 0.92)
- Genie 3 —permet→ génération vidéo interactive contrôlable (CONCEPT, 0.97)
- Genie 3 —est_basé_sur→ vidéos de jeux vidéo platformer (CONCEPT, 0.9)
- Genie 3 —permet→ compréhension émergente de la physique (CONCEPT, 0.88)
- Genie 3 —améliore→ cohérence temporelle (CONCEPT, 0.93)
- Genie 3 —concurrence→ OpenAI Sora (TECHNOLOGIE, 0.85)
- Genie 3 —concurrence→ Runway Gen-3 (TECHNOLOGIE, 0.85)
- Genie 3 —permet→ prototypage rapide de jeux (CONCEPT, 0.87)
- world model latent —améliore→ développement de jeux vidéo (CONCEPT, 0.82)
- Google DeepMind —fait_partie_de→ Google DeepMind (ORGANISATION, 0.99)
- Genie 3 —utilise→ contrôle par actions (CONCEPT, 0.88)

---
Canonical: https://www.thekb.eu/de/fiches/google-genie-3-video-generation-model-deepmind-2025-08-05/
