MuZero:不显式建模观测的世界模型
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
1. 为什么叫「隐式」?
经典 model-based RL 常预测下一观测
三个网络:
| 符号 | 作用 |
|---|---|
| 表示:观测 → 潜状态 | |
| 动力学:潜状态 + 动作 → 下一潜状态 + 奖励 | |
| 预测:潜状态 → 策略与价值 |
搜索(MCTS)在潜空间展开,用
逐步说明:为何不重建像素仍能规划(点击展开)
MCTS 需要的是:从当前信念走一步到下一信念、这一步的即时奖励、叶子上的价值与策略先验。

图解说明:
把观测压成潜状态; 在潜空间走一步并预测奖励; 给出策略先验与价值。MCTS 完全在潜空间展开——不必重建像素,只要对规划「够用」。
2. 训练目标(直觉)
沿真实轨迹展开
- 策略:搜索改进后的
vs 的策略头 - 价值:n-step / Bootstrap 回报
- 奖励:动力学头预测的即时奖励
3. 与 Dreamer 对比
| Dreamer | MuZero | |
|---|---|---|
| 世界模型 | 显式潜观测/重构倾向强 | 隐式,面向搜索 |
| 决策 | 想象轨迹上 actor-critic | MCTS + 学习模型 |
| 典型舞台 | 连续控制、视觉控制 | 棋类、Atari 规划 |
4. 代码
demo.py 用捕猎一维任务对比 greedy 与 search-like 策略。
5. 小结
MuZero 证明:为决策服务的世界模型可以不重建观测。下一章转向表示预测路线 JEPA。