# google-deepmind-project-genie-3-world-models-2026-02

## Veille

Project Genie - Real-Time Interactive World Models from Google DeepMind

## Titre Article

Project Genie: Interactive World Models with Genie 3

## Date

2026-02

## URL

https://www.youtube.com/watch?v=Ow0W3WlJxRY

## Keywords

World Models, Project Genie, Genie 3, Google DeepMind, Google Labs, interaktive Weltgenerierung, Echtzeit, Nano Banana Pro, Simulation, Robotik, verkörperte Intelligenz, Simmer, KI-Agenten, interaktive Medien, virtuelle Realität

## Authors

Logan Kilpatrick (Google DeepMind), Diego Schlomi (Google DeepMind), Jack (Google DeepMind)

## Ton

**Profil**: Technisches Gespräch unter Mitgliedern des Produkt-/Forschungsteams, zugängliches und enthusiastisches Register, moderates technisches Niveau mit Popularisierung

**Beschreibung**: „Release Notes“-Podcast-Format mit drei Sprechern von Google DeepMind, die Project Genie in Gesprächsform präsentieren. Der Ton entspricht einer entspannten Produktdemo, die zwischen zugänglichen technischen Erklärungen und Momenten spontaner Entdeckung während Live-Demos wechselt. Die Begeisterung ist spürbar, aber gedämpft, mit Ehrlichkeit über die aktuellen Grenzen des Modells. Die Sprecher nehmen die Haltung von Entdeckern ein, die eine Grenztechnologie teilen, und laden das Publikum ein zu experimentieren, statt ein fertiges Produkt zu konsumieren. Die Zielgruppe ist breit: Entwickler, Kreative, technikaffine Early Adopters.

## Pense-betes

- **World Model vs. Videomodell**: Ein Videomodell erzeugt eine feste Sequenz; ein World Model generiert Bild für Bild mit Echtzeit-Nutzersteuerung (links/rechts/Aktionen)
- **Project Genie = Consumer-App**: Das Äquivalent dessen, was Flow/ISK für VO sind, gestartet für Google US Ultra-Abonnenten
- **Kreative Pipeline**: Nano Banana Pro erzeugt zunächst ein „Canvas“-Bild, dann verwandelt Genie 3 dieses Bild in eine erkundbare Welt
- **Zentrale Personalisierung**: Hochladen persönlicher Fotos (Spielzeug, Objekte, Räume), um sie zu animieren – ein Differenzierungsmerkmal gegenüber anderen Systemen
- **60-Sekunden-Limit**: Kosten-/Bereitstellungs-Kompromiss, Dynamik nimmt allmählich ab, „zwei Ein-Minuten-Welten > eine Zwei-Minuten-Welt“
- **Implizite Physik**: Das Modell lernt implizit, wie sich die Welt entwickelt (rollende Bälle, spritzendes Wasser)
- **Ein schwierigeres Problem als Video**: Keine Freiheit, vergangene/zukünftige Bilder zu ändern, muss sowohl mit der Vergangenheit ALS AUCH mit der unmittelbaren Aktion konsistent sein
- **Genie-Entwicklung**: Genie 1 (Forschungspapier) → Genie 2 (Dez. 2024, 10 s, niedrige Auflösung) → Genie 3 (Ankündigung Aug. 2025, 1 Min. Echtzeit, fotorealistisch)
- **Simmer-Anwendungsfall**: Gemini-Agent, der in 3D-Welten interagieren kann, trainiert in Genie-3-Welten, um Generalisierung zu testen
- **Erwähnte Roadmap**: Multiplayer (komplexe Latenz), mehr Steuerungen/Interaktionen, Entwickler-API, Oberflächen jenseits der App
- **„Prompting is back“**: Das Modell ist noch nicht robust gegenüber Prompting, Experimentieren ist erforderlich – eine Chance für Early Adopters
- **Langfristige Vision**: „Eine Kopie des Universums, in der man tun kann, was man will“ – eine von der Realität nicht zu unterscheidende Simulation als Leitstern

## RésuméDe400mots

Google DeepMind bringt Project Genie auf den Markt, eine Webanwendung, mit der Google US Ultra-Abonnenten interaktive Welten erstellen und erkunden können, die vom Modell Genie 3 generiert werden. Im Gegensatz zu konventionellen Videomodellen, die feste Sequenzen erzeugen, generiert ein „World Model“ die Umgebung Bild für Bild in Echtzeit und ermöglicht es dem Nutzer, zu navigieren und zu interagieren.

**Workflow und kreative Pipeline**: Der Nutzer beginnt damit, seine Welt und seinen Charakter zu beschreiben. Nano Banana Pro erzeugt zunächst ein „Canvas“-Bild, das als visueller Ausgangspunkt dient. Ein Klick auf „Generate World“ veranlasst Genie 3, dieses 2D-Bild in eine erkundbare 3D-Umgebung zu verwandeln. Der Übergang von 2D zu immersivem 3D ist der von Testern identifizierte „Wow-Moment“. Die Anwendung erlaubt zudem das Hochladen persönlicher Fotos – ein fotografiertes Spielzeugdinosaurier kann so zu einer steuerbaren Figur in einer Rekonstruktion des Zimmers werden.

**Technische Herausforderungen**: Genie 3 löst ein komplexeres Problem als die Standard-Videogenerierung. Ein Videomodell kann Bilder nachträglich anpassen, um Konsistenz zu gewährleisten; Genie 3 muss in Echtzeit generieren, konsistent sowohl mit der Vergangenheit ALS AUCH mit der unmittelbaren Aktion des Nutzers, ohne zukünftige Eingaben zu kennen. Die aktuelle Begrenzung auf 60 Sekunden resultiert aus einem Kompromiss: Die Dynamik der Welt nimmt tendenziell allmählich ab, und die Bereitstellungskosten bleiben hoch.

**Entwicklung seit Genie 1**: Genie 1 war ein Forschungspapier. Genie 2 (Dezember 2024) bot 10 Sekunden in niedriger Auflösung, ohne Echtzeit. Genie 3 (angekündigt im August 2025, jetzt gestartet) erreicht eine Minute in Echtzeit mit fotorealistischer Qualität. Das Team stellt fest, dass vor einem Jahr eine Minute Echtzeit-Konsistenz als ehrgeiziges Ziel erschien; heute fordern Nutzer mehr.

**Angedachte Anwendungen**: Über die Unterhaltung hinaus untersucht das Team Bildung (personalisierte therapeutische Expositionen, etwa ein Kind, das ein mit virtuellen Spinnen gefülltes Zimmer erkundet) und verkörperte Intelligenz. Das Projekt Simmer nutzt Genie 3 bereits, um KI-Agenten zu trainieren, die Ziele in beliebigen 3D-Welten erreichen können – ein Schritt in Richtung verkörperter AGI.

**Ausblick**: Die Roadmap umfasst Multiplayer (komplex wegen der Latenz), mehr Interaktionssteuerungen, eine Entwickler-API und die Erweiterung auf andere Oberflächen. Das Team schätzt, 50 % seiner Vision erreicht zu haben, mit „enormem Spielraum“ für weitere Verbesserungen. Die ultimative Vision: eine von der Realität nicht zu unterscheidende Simulation, „eine Kopie des Universums, in der man tun kann, was man will“.

## GrapheDeConnaissance

- Google DeepMind —a_créé→ Genie 3 (TECHNOLOGIE, 0.99)
- Google DeepMind —publie→ Project Genie (TECHNOLOGIE, 0.99)
- Project Genie —est_basé_sur→ Genie 3 (TECHNOLOGIE, 0.98)
- Project Genie —utilise→ Nano Banana Pro (TECHNOLOGIE, 0.97)
- Genie 3 —remplace→ Genie 2 (TECHNOLOGIE, 0.98)
- Google DeepMind —publie→ Genie 2 (TECHNOLOGIE, 0.95)
- Genie 3 —est_instance_de→ modèles de monde interactifs (CONCEPT, 0.95)
- Google DeepMind —affirme_que→ les world models résolvent un problème plus difficile que les modèles vidéo (AFFIRMATION, 0.97)
- Simmer —utilise→ Genie 3 (TECHNOLOGIE, 0.96)
- Simmer —fait_partie_de→ Google DeepMind (ORGANISATION, 0.9)
- Google Labs —collabore_avec→ Google DeepMind (ORGANISATION, 0.97)
- Genie 3 —s_applique_à→ intelligence incarnée (CONCEPT, 0.88)
- Logan Kilpatrick —dirige→ Release Notes (EVENEMENT, 0.99)
- modèles de monde interactifs —permet→ génération temps réel (CONCEPT, 0.96)
- Google DeepMind —prédit→ simulation indistinguable de la réalité (AFFIRMATION, 0.82)

---
Canonical: https://www.thekb.eu/de/fiches/google-deepmind-project-genie-3-world-models-2026-02/
