Skip to content

MuZero:不显式建模观测的世界模型

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

1. 为什么叫「隐式」?

经典 model-based RL 常预测下一观测 o^t+1。MuZero(Schrittwieser et al., 2020)发现:对规划而言,不必重建像素;只需潜状态足以预测奖励、策略与价值。

三个网络:

符号作用
h表示:观测 → 潜状态
g动力学:潜状态 + 动作 → 下一潜状态 + 奖励
f预测:潜状态 → 策略与价值

搜索(MCTS)在潜空间展开,用 f 提供先验与叶子价值。

逐步说明:为何不重建像素仍能规划(点击展开)

MCTS 需要的是:从当前信念走一步到下一信念、这一步的即时奖励、叶子上的价值与策略先验。gf 直接输出这些。像素重建是充分不必要——只要 h(o) 对规划可区分输赢即可。训练用真实轨迹上的 K 步展开,让 f 的策略对上 MCTS 改进后的 π,价值对上 bootstrap 回报。和 Dreamer 的差别:Dreamer 用可微想象训 Actor;MuZero 用搜索改进目标再蒸馏回 f

MuZero 三模块

图解说明h 把观测压成潜状态;g 在潜空间走一步并预测奖励;f 给出策略先验与价值。MCTS 完全在潜空间展开——不必重建像素,只要对规划「够用」。

2. 训练目标(直觉)

沿真实轨迹展开 K 步,对齐:

  • 策略:搜索改进后的 π vs f 的策略头
  • 价值:n-step / Bootstrap 回报
  • 奖励:动力学头预测的即时奖励

3. 与 Dreamer 对比

DreamerMuZero
世界模型显式潜观测/重构倾向强隐式,面向搜索
决策想象轨迹上 actor-criticMCTS + 学习模型
典型舞台连续控制、视觉控制棋类、Atari 规划

4. 代码

demo.py 用捕猎一维任务对比 greedy 与 search-like 策略。

5. 小结

MuZero 证明:为决策服务的世界模型可以不重建观测。下一章转向表示预测路线 JEPA