# google-deepmind-project-genie-3-world-models-2026-02

## Veille

Project Genie - Modelli di mondo interattivi in tempo reale di Google DeepMind

## Titre Article

Project Genie: Interactive World Models with Genie 3

## Date

2026-02

## URL

https://www.youtube.com/watch?v=Ow0W3WlJxRY

## Keywords

World models, Project Genie, Genie 3, Google DeepMind, Google Labs, generazione di mondi interattivi, tempo reale, Nano Banana Pro, simulazione, robotica, intelligenza incarnata, Simmer, agenti IA, media interattivi, realtà virtuale

## Authors

Logan Kilpatrick (Google DeepMind), Diego Schlomi (Google DeepMind), Jack (Google DeepMind)

## Ton

**Profilo**: Conversazione tecnica tra membri del team prodotto/ricerca, registro accessibile ed entusiasta, livello tecnico moderato con divulgazione

**Descrizione**: Formato podcast "Release Notes" con tre relatori di Google DeepMind che presentano Project Genie in modo colloquiale. Il tono è quello di una demo di prodotto rilassata, che alterna spiegazioni tecniche accessibili a momenti di scoperta spontanea durante le demo dal vivo. L'entusiasmo è palpabile ma misurato, con onestà riguardo ai limiti attuali del modello. I relatori assumono la postura di esploratori che condividono una tecnologia di frontiera, invitando il pubblico a sperimentare piuttosto che a consumare un prodotto finito. Il pubblico target è ampio: sviluppatori, creativi, early adopter esperti di tecnologia.

## Pense-betes

- **World model vs modello video**: Un modello video genera una sequenza fissa; un world model genera fotogramma per fotogramma con controllo utente in tempo reale (sinistra/destra/azioni)
- **Project Genie = app consumer**: L'equivalente di ciò che Flow/ISK sono per il video (VO), lanciato per gli abbonati Google US Ultra
- **Pipeline creativa**: Nano Banana Pro genera prima un'immagine "canvas", poi Genie 3 trasforma questa immagine in un mondo esplorabile
- **Personalizzazione chiave**: Caricare foto personali (giocattoli, oggetti, spazi) per animarli - un elemento distintivo rispetto ad altri sistemi
- **Limite di 60 secondi**: Compromesso costo/erogazione, il dinamismo diminuisce gradualmente, "due mondi da un minuto > un mondo da due minuti"
- **Fisica implicita**: Il modello apprende implicitamente come evolve il mondo (palle che rotolano, acqua che schizza)
- **Un problema più difficile del video**: Nessuna libertà di modificare i fotogrammi passati/futuri, deve essere coerente sia con il passato SIA con l'azione immediata
- **Traiettoria di Genie**: Genie 1 (paper di ricerca) → Genie 2 (dic 2024, 10s, bassa risoluzione) → Genie 3 (annuncio ago 2025, 1 min tempo reale fotorealistico)
- **Caso d'uso Simmer**: Agente Gemini capace di interagire in mondi 3D, addestrato in mondi Genie 3 per testare la generalizzazione
- **Roadmap menzionata**: Multiplayer (latenza complessa), più controlli/interazioni, API per sviluppatori, superfici oltre l'app
- **"Il prompting è tornato"**: Il modello non è ancora robusto al prompting, è necessaria la sperimentazione - un'opportunità per gli early adopter
- **Visione a lungo termine**: "Una copia dell'universo in cui puoi fare tutto ciò che vuoi" - una simulazione indistinguibile dalla realtà come stella polare

## RésuméDe400mots

Google DeepMind lancia Project Genie, un'applicazione web che consente agli abbonati Google US Ultra di creare ed esplorare mondi interattivi generati dal modello Genie 3. A differenza dei modelli video convenzionali che producono sequenze fisse, un "world model" genera l'ambiente fotogramma per fotogramma in tempo reale, consentendo all'utente di navigare e interagire.

**Flusso di lavoro e pipeline creativa**: L'utente inizia descrivendo il proprio mondo e il proprio personaggio. Nano Banana Pro genera prima un'immagine "canvas" che funge da punto di partenza visivo. Cliccando su "Generate World", Genie 3 trasforma questa immagine 2D in un ambiente 3D esplorabile. Il passaggio dal 2D al 3D immersivo è il "wow moment" identificato dai tester. L'applicazione consente inoltre di caricare foto personali - un dinosauro giocattolo fotografato può diventare un personaggio controllabile in una ricostruzione della stanza.

**Sfide tecniche**: Genie 3 affronta un problema più complesso della generazione video standard. Un modello video può regolare retroattivamente i fotogrammi per garantire la coerenza; Genie 3 deve generare in tempo reale, coerentemente sia con il passato SIA con l'azione immediata dell'utente, senza conoscere gli input futuri. L'attuale limite di 60 secondi deriva da un compromesso: il dinamismo del mondo tende a diminuire gradualmente e i costi di erogazione restano elevati.

**Evoluzione da Genie 1**: Genie 1 era un paper di ricerca. Genie 2 (dicembre 2024) offriva 10 secondi a bassa risoluzione, senza tempo reale. Genie 3 (annunciato nell'agosto 2025, ora lanciato) raggiunge un minuto in tempo reale con qualità fotorealistica. Il team osserva che un anno fa un minuto di coerenza in tempo reale sembrava un obiettivo ambizioso; oggi gli utenti ne chiedono di più.

**Applicazioni previste**: Oltre all'intrattenimento, il team esplora l'ambito educativo (esposizioni terapeutiche personalizzate, come un bambino che esplora una stanza piena di ragni virtuali) e l'intelligenza incarnata. Il progetto Simmer utilizza già Genie 3 per addestrare agenti IA capaci di raggiungere obiettivi in mondi 3D arbitrari - un passo verso l'AGI incarnata.

**Prospettive**: La roadmap include il multiplayer (complesso per via della latenza), più controlli di interazione, un'API per sviluppatori e l'espansione ad altre superfici. Il team stima di aver raggiunto il 50% della propria visione, con un "margine di miglioramento enorme" ancora disponibile. La visione ultima: una simulazione indistinguibile dalla realtà, "una copia dell'universo in cui puoi fare tutto ciò che vuoi".

## GrapheDeConnaissance

- Google DeepMind —a_créé→ Genie 3 (TECHNOLOGIE, 0.99)
- Google DeepMind —publie→ Project Genie (TECHNOLOGIE, 0.99)
- Project Genie —est_basé_sur→ Genie 3 (TECHNOLOGIE, 0.98)
- Project Genie —utilise→ Nano Banana Pro (TECHNOLOGIE, 0.97)
- Genie 3 —remplace→ Genie 2 (TECHNOLOGIE, 0.98)
- Google DeepMind —publie→ Genie 2 (TECHNOLOGIE, 0.95)
- Genie 3 —est_instance_de→ modèles de monde interactifs (CONCEPT, 0.95)
- Google DeepMind —affirme_que→ les world models résolvent un problème plus difficile que les modèles vidéo (AFFIRMATION, 0.97)
- Simmer —utilise→ Genie 3 (TECHNOLOGIE, 0.96)
- Simmer —fait_partie_de→ Google DeepMind (ORGANISATION, 0.9)
- Google Labs —collabore_avec→ Google DeepMind (ORGANISATION, 0.97)
- Genie 3 —s_applique_à→ intelligence incarnée (CONCEPT, 0.88)
- Logan Kilpatrick —dirige→ Release Notes (EVENEMENT, 0.99)
- modèles de monde interactifs —permet→ génération temps réel (CONCEPT, 0.96)
- Google DeepMind —prédit→ simulation indistinguable de la réalité (AFFIRMATION, 0.82)

---
Canonical: https://www.thekb.eu/it/fiches/google-deepmind-project-genie-3-world-models-2026-02/
