Skip to content

路径三导论:把世界压进 z,再在里面做梦

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

路径一/二把观测生成得越来越像真的。路径三反过来:预测对象要便宜,好让智能体用同一条真经验想象出许多条,并在想象里选动作或学策略。


一、共用骨架

zt=enc(ot,a<t),z^t+1=fθ(zt,at),然后 MPC 或 Actor-Critic

导论 里的序列 ELBO(先验 vs 后验)主要是为这条路径服务的:训练时用后验 q(ot),部署时多步只滚先验,就是「做梦」。

角色
PETS状态已干净时:概率集成 + CEM-MPC(规划原型)
RSSM / PlaNet像素 → 随机状态空间,把 CEM 搬进潜空间
Dreamer想象轨迹上的 Actor-Critic;V4 开始接开放视频先验
MuZero不重建观测,隐式模型 + 搜索
JEPA预测表征而非像素
LeWM把 JEPA 收成可规划的两项损失

建议顺序与上表一致。MuZero 可在 Dreamer 后穿插:对比「重建观测」vs「只为搜索服务的隐式模型」。

逐步说明:路径三共用骨架里 zfθ 和规划各干什么(点击展开)

zt=enc(ot,a<t) 是压缩信念,不必是物理状态。fθ(zt,at) 在这个空间里走一步。MPC:在 z 上采样动作序列,用 fH 步,挑回报最高的第一条动作执行。Actor-Critic:在想象轨迹上对 π 反传,不再每步问真环境。PETS 假定 z 已是干净状态;RSSM 要从像素学出 z;Dreamer 把规划换成可微策略;MuZero 连重建都可以不要,只要搜索准。

PETS、Dreamer、LeWM(以及 JEPA 的火柴杆附录)共用同一套倒立摆物理(θ=0 竖直向上,观测 [cosθ,sinθ,ω] 或由其渲染的帧):先看状态空间 CEM,再看想象里的 Actor-Critic,最后看像素嵌入上的目标 CEM。


二、和其余路径

下一章:PETS