Skip to content

世界模型导论:五条路径

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

「如果一个系统能在脑海中模拟世界,它就不需要真的撞上南墙才知道疼。」侧栏顺序上,本章接在 控制论机器人学 之后、科学计算 之前:先有反馈与刚体几何,再谈「学一个世界来规划」。潜变量上的 KL 见 信息论精简;观测压缩的极限见 信息论


一、什么是世界模型?

世界模型(World Model) 是智能体内部关于环境动力学的预测模型:给定当前状态(或观测)与动作,预测接下来会发生什么,从而在不与真实环境逐步试错的情况下模拟、规划、学习。

zt=enc(ot,a<t)表示z^t+1=fθ(zt,at)动力学o^t,r^t=解码 / 奖励(可选)
维度模型无关 RL世界模型(Model-Based)
学习对象Q / π先学 fθ,再规划或学策略
样本效率高(一条真经验可想象多条)
风险必须真实试错可先在模型里「撞墙」
代表DQN、PPOPETS、PlaNet、Dreamer、Genie、Sora/Cosmos

二、为什么用「五条路径」而不是一张杂货清单?

近年 survey(如 Learning to Model the WorldAgentic World Modeling)与开源 Awesome 列表里,方法名爆炸。教学上我们按你要世界模型干什么收成五条主路径——它们互补,不是互斥排名:

世界模型五条路径

图解说明:本章 demo.py 生成的分类地图。路径一从 GAN/VAE/扩散讲到视频 WM;路径五是谓词、程序与 LLM 规则对齐。旧图 wm01-02-four-paths.png 仍可对照「补符号之前」的四路径版本。

路径关键问题预测对象代表
一 · 视频生成未来「长什么样」?像素 / 视频潜空间GAN → VAE → 扩散 → Sora、Cosmos
二 · 交互 / 3D我能否「玩」这个世界?动作条件帧或 3D 场景Genie、HunyuanWorld、Marble
三 · 抽象状态预测如何在便宜的 z 里规划/学策略?状态 / 嵌入PETS、RSSM/PlaNet、Dreamer、MuZero、JEPA、LeWM
四 · 因果世界模型相关还是可干预?P(ydo(a))、反事实LLM-CWM、NTP 因果分析
五 · 符号 / 神经符号定律能否写成可执行符号?谓词、规则、程序pix2pred、COSMOS(ICLR)、WALL-E、PoE-World、NeSyS

旧版「六路径」把 RSSM、MuZero、JEPA、Genie、视频、LLM 并列。后来收成四条,并把 LLM 贬到附录。这一版把 GAN/VAE/扩散从计算机视觉挪进路径一(分章细讲),再把 LLM 与 neurosymbolic 升为路径五:语言模型不再假装自己是主路径里的「第六种神经网络动力学」,而是符号接口 + 规则/程序世界模型。

NVIDIA Cosmos(视频基础模型)属于路径一;ICLR 2024 的 COSMOS(神经符号组合世界模型)属于路径五——名字撞车,不是同一系统。


三、认知与工程简史(仍值得知道)

  • Craik(1943):大脑构建现实的「小尺度模型」。
  • Ha & Schmidhuber(2018)World Models:V-M-C;策略可在梦里练。
  • PETS(2018):概率集成 + CEM-MPC——路径三的规划原型。
  • PlaNet / Dreamer(2019–2025):像素 → RSSM → 想象 Actor-Critic → V4 离线开放世界。
  • LeCun JEPA(2022–):预测表征而非像素;LeWM 把它收成可规划的两项损失。
  • Genie / Sora / Cosmos(2024–):交互生成与视频基础模型把「世界模型」推进媒体与具身数据引擎。

四、通用数学:先验、后验与想象

许多潜空间方法共享序列 ELBO 骨架(POMDP):

L=Eq[tlogp(otzt)DKL(q(ztzt1,at1,ot)p(ztzt1,at1))]
  • 后验 q:看见 ot 后的信念(训练);
  • 先验 p:不看 ot 的预测(想象 / 规划);
  • 部署时多步只滚先验,就是「做梦」。
逐步说明:训练用后验、做梦用先验,KL 在惩罚什么(点击展开)

看见 ot 时,后验 q(zt,ot) 把信念钉在与这帧一致的 z 上,重建项 logp(otzt) 才好优化。部署时没有未来观测(或故意不用),只能用先验 p(ztzt1,at1) 往前滚——这叫想象。若先验和后验差太远,做梦会立刻离开数据流形,规划全错。KL 项逼先验去追后验:闭眼预测要尽量像睁眼修正。

路径一在像素上滚,观感好、规划贵。路径三把 z 做小,同一条真轨迹可在模型里分叉出许多动作序列。路径四提醒:旁观视频里的 P(ot+1ot) 未必等于 P(ot+1do(a))

路径一可能直接在像素/视频潜空间做生成;路径四追问你滚的到底是 P 还是 P(do(a));路径五追问同一件事能不能写成谓词与规则。


五、为什么路径三坚持「在潜空间做梦」?

多步想象是复合函数,误差会累积。像素里充满与决策无关的纹理,递归预测时雪球更大;压到任务相关的 z,同样视野更安全。demo.py 用玩具曲线对比这一直觉(见下图)。

潜空间 vs 像素空间的多步误差

图解说明:同一套玩具动力学,在像素空间开环滚和在潜空间滚。像素纹理误差雪球更大;压到任务相关的 z 后,同样视野更稳。这是路径三坚持做梦要便宜的原因。


六、学习路线图

建议顺序:导论 → 路径一按 GAN → VAE → 扩散 → 视频 WM → 路径二 → 路径三按 PETS → PlaNet → Dreamer → JEPA → LeWM(MuZero 可穿插)→ 路径四 → 路径五。


七、本节小结

概念一句话
世界模型内部动力学预测器,用于想象与决策
五路径视频生成 / 交互·3D / 抽象状态 / 因果 / 符号
先验·后验做梦用先验,训练常用后验
潜空间降低多步误差,服务规划
互补好看、可玩、可算、可干预——常常要组合

下一节建议:路径一导论,从 GAN 讲起。若你更关心控制,也可直奔 PETS;若关心谓词与 LLM 规则,可先看 路径五

📥 Code

FileViewDownload
demo.pyOpenDownload
exercise.pyOpenDownload

参考

  1. Craik, K. (1943). The Nature of Explanation.
  2. Ha, D., & Schmidhuber, J. (2018). World Models. [arXiv:1803.10122]
  3. Chua, K., et al. (2018). PETS. [arXiv:1805.12114]
  4. Hafner, D., et al. PlaNet / Dreamer 系列.
  5. LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence.
  6. Lyu, Q., Dong, J., et al. Learning to Model the World(survey).
  7. Chu, M., et al. (2026). Agentic World Modeling. [arXiv:2604.22748]
  8. Sehgal, A., et al. (2024). Neurosymbolic Grounding for Compositional World Models. ICLR. [arXiv:2310.12690]
  9. Zhou, S., et al. WALL-E / WALL-E 2.0. [arXiv:2410.07484]
  10. Hu, M., et al. (2025). Text2World. [arXiv:2502.13092]