路径二导论:从「好看」到「可玩」
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
路径一回答「下一段视频长什么样」。路径二多问一句:我能不能用动作改写这段未来,并在场景里待下去? 动作从「弱条件 / 后置」变成一等公民。
一、这条路径在解决什么?
- 潜动作(Genie):视频里挖出来的可控因子,不一定等于键盘语义;
- 显式接口(3D / 场景 WM):相机、抓取、传送。
逐步说明:路径二的成功标准为何不是 FVD(点击展开)
FVD 只问「像不像视频」。可玩要求:固定前缀,扭动动作,未来必须分叉,且人能待在场景里。潜动作系统和 3D 系统都把
- 潜动作(Genie):视频里挖出来的可控因子,不一定等于键盘语义;
- 显式接口(3D / 场景 WM):相机、抓取、传送。
| 路径一 | 路径二 | 路径三 | |
|---|---|---|---|
| 输出 | 开放视觉视频 | 可玩帧或可漫游 3D | 紧凑 |
| 动作 | 常弱或后置 | 核心 | 控制用 |
| 成功标准 | FVD / 观感 | 同一前缀、不同动作 ⇒ 不同未来 | 回报 / 规划误差 |
二、本路径两章
读完路径一再进这两章,对照会更清楚:生成技术可以共用,目标函数与评测不能共用。
三、和路径一、三、五的交界
- 视频基础模型加动作条件微调后可以做机器人 MPC,但算力往往比 Dreamer / LeWM 贵几个数量级——这是路径一往路径二/三渗透,不是互相取代。
- 若你要的是「谓词级可规划状态」而不是可玩像素,走 路径五。
下一章:Genie。