Skip to content

路径二导论:从「好看」到「可玩」

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

路径一回答「下一段视频长什么样」。路径二多问一句:我能不能用动作改写这段未来,并在场景里待下去? 动作从「弱条件 / 后置」变成一等公民。


一、这条路径在解决什么?

pθ(ot+1ot,at)3D 场景(t+1)=f(场景(t),at相机/交互)

at 可以是:

  • 潜动作(Genie):视频里挖出来的可控因子,不一定等于键盘语义;
  • 显式接口(3D / 场景 WM):相机、抓取、传送。
逐步说明:路径二的成功标准为何不是 FVD(点击展开)

FVD 只问「像不像视频」。可玩要求:固定前缀,扭动动作,未来必须分叉,且人能待在场景里。潜动作系统和 3D 系统都把 a 当一等公民,但一个从数据里发现控制,一个把控制焊在几何接口上。与路径三比:这里输出仍贵(帧或场景),规划可以后置,不是主目标。

  • 潜动作(Genie):视频里挖出来的可控因子,不一定等于键盘语义;
  • 显式接口(3D / 场景 WM):相机、抓取、传送。
路径一路径二路径三
输出开放视觉视频可玩帧或可漫游 3D紧凑 z
动作常弱或后置核心控制用 at
成功标准FVD / 观感同一前缀、不同动作 ⇒ 不同未来回报 / 规划误差

二、本路径两章

  1. Genie:无动作标签的视频 → 潜动作 + 下一帧生成。「可玩」优先于「单纯逼真」。
  2. 交互式 3D:把接口做成相机与持久几何(HunyuanWorld、Marble、3DGS 系)。

读完路径一再进这两章,对照会更清楚:生成技术可以共用,目标函数与评测不能共用。


三、和路径一、三、五的交界

  • 视频基础模型加动作条件微调后可以做机器人 MPC,但算力往往比 Dreamer / LeWM 贵几个数量级——这是路径一往路径二/三渗透,不是互相取代。
  • 若你要的是「谓词级可规划状态」而不是可玩像素,走 路径五

下一章:Genie