世界模型导论:五条路径
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
「如果一个系统能在脑海中模拟世界,它就不需要真的撞上南墙才知道疼。」侧栏顺序上,本章接在 控制论 与 机器人学 之后、科学计算 之前:先有反馈与刚体几何,再谈「学一个世界来规划」。潜变量上的 KL 见 信息论精简;观测压缩的极限见 信息论。
一、什么是世界模型?
世界模型(World Model) 是智能体内部关于环境动力学的预测模型:给定当前状态(或观测)与动作,预测接下来会发生什么,从而在不与真实环境逐步试错的情况下模拟、规划、学习。
| 维度 | 模型无关 RL | 世界模型(Model-Based) |
|---|---|---|
| 学习对象 | 先学 | |
| 样本效率 | 低 | 高(一条真经验可想象多条) |
| 风险 | 必须真实试错 | 可先在模型里「撞墙」 |
| 代表 | DQN、PPO | PETS、PlaNet、Dreamer、Genie、Sora/Cosmos |
二、为什么用「五条路径」而不是一张杂货清单?
近年 survey(如 Learning to Model the World、Agentic World Modeling)与开源 Awesome 列表里,方法名爆炸。教学上我们按你要世界模型干什么收成五条主路径——它们互补,不是互斥排名:

图解说明:本章
demo.py生成的分类地图。路径一从 GAN/VAE/扩散讲到视频 WM;路径五是谓词、程序与 LLM 规则对齐。旧图wm01-02-four-paths.png仍可对照「补符号之前」的四路径版本。
| 路径 | 关键问题 | 预测对象 | 代表 |
|---|---|---|---|
| 一 · 视频生成 | 未来「长什么样」? | 像素 / 视频潜空间 | GAN → VAE → 扩散 → Sora、Cosmos |
| 二 · 交互 / 3D | 我能否「玩」这个世界? | 动作条件帧或 3D 场景 | Genie、HunyuanWorld、Marble |
| 三 · 抽象状态预测 | 如何在便宜的 | 状态 / 嵌入 | PETS、RSSM/PlaNet、Dreamer、MuZero、JEPA、LeWM |
| 四 · 因果世界模型 | 相关还是可干预? | LLM-CWM、NTP 因果分析 | |
| 五 · 符号 / 神经符号 | 定律能否写成可执行符号? | 谓词、规则、程序 | pix2pred、COSMOS(ICLR)、WALL-E、PoE-World、NeSyS |
旧版「六路径」把 RSSM、MuZero、JEPA、Genie、视频、LLM 并列。后来收成四条,并把 LLM 贬到附录。这一版把 GAN/VAE/扩散从计算机视觉挪进路径一(分章细讲),再把 LLM 与 neurosymbolic 升为路径五:语言模型不再假装自己是主路径里的「第六种神经网络动力学」,而是符号接口 + 规则/程序世界模型。
NVIDIA Cosmos(视频基础模型)属于路径一;ICLR 2024 的 COSMOS(神经符号组合世界模型)属于路径五——名字撞车,不是同一系统。
三、认知与工程简史(仍值得知道)
- Craik(1943):大脑构建现实的「小尺度模型」。
- Ha & Schmidhuber(2018)World Models:V-M-C;策略可在梦里练。
- PETS(2018):概率集成 + CEM-MPC——路径三的规划原型。
- PlaNet / Dreamer(2019–2025):像素 → RSSM → 想象 Actor-Critic → V4 离线开放世界。
- LeCun JEPA(2022–):预测表征而非像素;LeWM 把它收成可规划的两项损失。
- Genie / Sora / Cosmos(2024–):交互生成与视频基础模型把「世界模型」推进媒体与具身数据引擎。
四、通用数学:先验、后验与想象
许多潜空间方法共享序列 ELBO 骨架(POMDP):
- 后验
:看见 后的信念(训练); - 先验
:不看 的预测(想象 / 规划); - 部署时多步只滚先验,就是「做梦」。
逐步说明:训练用后验、做梦用先验,KL 在惩罚什么(点击展开)
看见
路径一在像素上滚,观感好、规划贵。路径三把
路径一可能直接在像素/视频潜空间做生成;路径四追问你滚的到底是
五、为什么路径三坚持「在潜空间做梦」?
多步想象是复合函数,误差会累积。像素里充满与决策无关的纹理,递归预测时雪球更大;压到任务相关的 demo.py 用玩具曲线对比这一直觉(见下图)。

图解说明:同一套玩具动力学,在像素空间开环滚和在潜空间滚。像素纹理误差雪球更大;压到任务相关的
后,同样视野更稳。这是路径三坚持做梦要便宜的原因。
六、学习路线图
建议顺序:导论 → 路径一按 GAN → VAE → 扩散 → 视频 WM → 路径二 → 路径三按 PETS → PlaNet → Dreamer → JEPA → LeWM(MuZero 可穿插)→ 路径四 → 路径五。
七、本节小结
| 概念 | 一句话 |
|---|---|
| 世界模型 | 内部动力学预测器,用于想象与决策 |
| 五路径 | 视频生成 / 交互·3D / 抽象状态 / 因果 / 符号 |
| 先验·后验 | 做梦用先验,训练常用后验 |
| 潜空间 | 降低多步误差,服务规划 |
| 互补 | 好看、可玩、可算、可干预——常常要组合 |
下一节建议:路径一导论,从 GAN 讲起。若你更关心控制,也可直奔 PETS;若关心谓词与 LLM 规则,可先看 路径五。
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| exercise.py | Open | Download |
参考
- Craik, K. (1943). The Nature of Explanation.
- Ha, D., & Schmidhuber, J. (2018). World Models. [arXiv:1803.10122]
- Chua, K., et al. (2018). PETS. [arXiv:1805.12114]
- Hafner, D., et al. PlaNet / Dreamer 系列.
- LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence.
- Lyu, Q., Dong, J., et al. Learning to Model the World(survey).
- Chu, M., et al. (2026). Agentic World Modeling. [arXiv:2604.22748]
- Sehgal, A., et al. (2024). Neurosymbolic Grounding for Compositional World Models. ICLR. [arXiv:2310.12690]
- Zhou, S., et al. WALL-E / WALL-E 2.0. [arXiv:2410.07484]
- Hu, M., et al. (2025). Text2World. [arXiv:2502.13092]