路径三导论:把世界压进 ,再在里面做梦
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
路径一/二把观测生成得越来越像真的。路径三反过来:预测对象要便宜,好让智能体用同一条真经验想象出许多条,并在想象里选动作或学策略。
一、共用骨架
导论 里的序列 ELBO(先验 vs 后验)主要是为这条路径服务的:训练时用后验
| 章 | 角色 |
|---|---|
| PETS | 状态已干净时:概率集成 + CEM-MPC(规划原型) |
| RSSM / PlaNet | 像素 → 随机状态空间,把 CEM 搬进潜空间 |
| Dreamer | 想象轨迹上的 Actor-Critic;V4 开始接开放视频先验 |
| MuZero | 不重建观测,隐式模型 + 搜索 |
| JEPA | 预测表征而非像素 |
| LeWM | 把 JEPA 收成可规划的两项损失 |
建议顺序与上表一致。MuZero 可在 Dreamer 后穿插:对比「重建观测」vs「只为搜索服务的隐式模型」。
逐步说明:路径三共用骨架里 、 和规划各干什么(点击展开)
PETS、Dreamer、LeWM(以及 JEPA 的火柴杆附录)共用同一套倒立摆物理(θ=0 竖直向上,观测
二、和其余路径
下一章:PETS。