Skip to content

Genie:交互式世界模型

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

1. 交互式世界模型

Genie(Google DeepMind)从大规模无动作标签视频中学习:潜动作接口 + 下一帧/下一状态生成,使人或策略能用动作「玩」生成环境。它是 路径二 的经典技术入口——重点不是一次性好看的视频,而是交互闭环

关键要素:

  • 潜动作:不一定等于键盘语义,而是数据里可复用的可控因子;
  • 动态模型:条件于动作的未来生成;
  • 可玩性:同一前缀、不同动作 ⇒ 不同未来。
逐步说明:无动作标签时「潜动作」在优化什么(点击展开)

视频只有帧。模型要同时发明离散/连续的 at,以及 p(ot+1ot,at)。可玩性损失:同一历史、不同 a 必须导致可区分的未来,否则 a 是空符号。潜动作不必等于方向键,部署时还要对齐到键盘或机器人接口。这和路径一「生成好看视频」的目标函数不同:这里交互闭环优先。

Genie 概念

图解说明:从视频里发现潜动作,再以动作为条件生成下一帧——「可玩」优先于「单纯逼真」。

2. 版本直觉

Genie-1 → 2 → 3:从 2D 可控世界走向更高分辨率、更长时一致性的实时交互。训练上常见:视频 tokenizer + 潜动作模型 + 动态预测器。

3. 与路径一、路径二·3D

Sora/Cosmos(路径一)Genie3D 场景 WM
动作弱/后置条件为主自监督潜动作相机/物体显式接口
输出视频可玩 2D(为主)世界可漫游 3D
强项开放视觉交互发现几何持久

下一章 交互式 3D 把「可玩」推进到显式三维场景。

4. 代码

demo 的玩具潜动作对齐与 rollout。

5. 小结

Genie 证明:动作可以从视频里长出来。要键位级或几何级接口,继续看 3D 章;要便宜规划,转到路径三。

📥 Code

FileViewDownload
demo.pyOpenDownload
exercise.pyOpenDownload

参考

  1. Bruce, J., et al. (2024). Genie: Generative Interactive Environments. [arXiv:2402.15391]