Skip to content

路径五导论:把世界写成可执行的符号

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

前四条路径主要用神经网络拟合 p(ot+1)p(zt+1zt,at)。路径五换一种表示:状态是谓词,动力学是规则 / PDDL / 程序,神经网络(含 LLM)负责提出符号、接地像素、或补全规则覆盖不到的角落。这是 neurosymbolic AI 与 LLM 规划在世界模型上的汇合,不是「再用一次 ChatGPT 当模拟器」那么简单。


一、为什么还要符号?

神经网络世界模型灵活,但有三笔账经常还不清:

  1. 数据:Dreamer / 视频扩散要海量交互或互联网视频;人从几次演示就能抽出「杯子在桌上」。
  2. 组合泛化:训练时见过红方块、蓝圆,测试时要推从未见过的红圆——纯向量槽位很容易绑死在共现上。
  3. 可检查的定律:Minecraft 里「木镐挖钻石必失败」是一条规则,不是 FVD 分数。幻觉的 LLM 模拟器会在这里翻车。

符号世界模型把动力学写成

st+1=Exec(Rules,st,at)PDDL: preconditioneffect

规划变成搜索(或 MPC 套在符号状态上),而不是在像素里滚一千步。代价是:符号从哪来?谁保证接地正确?随机性、连续物理怎么写进规则?

逐步说明:路径五和路径三都「可规划」,差在状态能不能打印(点击展开)

路径三的 z 是向量,规划器能滚,人读不懂,开放视觉靠编码器。路径五的 s 是谓词,可以写进日志、做单元测试(「木镐挖钻必失败」)。数据效率来自规则的组合,不是来自海量视频。失败则是接地错、规则覆盖不全、LLM 幻觉。demo 的钥匙—门:规则执行器换钥匙仍对;查找表只在训练转移上完美。


二、一张光谱,而不是一个算法名

端点状态动力学代表
纯符号谓词 / 对象手写或学习的算子经典规划、PDDL
LLM → 符号文本描述模型生成 PDDL / PythonText2World、WALL-E 规则
像素 → 谓词图像VLM 提谓词 + 符号算子学习pix2pred、R2L-LAMP
神经符号混合向量槽 + 属性符号可微规则绑定 / 能量约束COSMOSNeSyS
语义提问像素不问下一帧,问未来的语义 QASemantic World Models(下图)

Berg et al.(2025)把「世界模型」改写成关于未来的视觉问答:不必重建像素,只要能回答「动作之后杯子还在桌上吗」。这和路径三 JEPA「别预测像素」同方向,但接口是语言问题而不是嵌入。

Semantic World Models:VLM / 视频 WM / 语义 WM

图出自 Berg et al., Semantic World Models, arXiv:2510.19818, Figure 1。请对照原文:VLM 回答当前观察,视频 WM 预测未来像素,语义 WM 回答未来的语义问题并据此规划。引用仅用于教学说明。

SWM 用问答当规划信号

同上,Figure 2。条件于动作的 VLM 回答被转成规划目标;不必先训练一个像素级前向模型。


三、本路径四章怎么读

  1. 视觉接地:符号从图像里长出来(VLM 谓词、神经符号槽、从演示发明关系)。
  2. 程序化动力学:世界模型 = 可执行代码或 PDDL;评测用执行而不是 BLEU。
  3. 世界对齐:LLM 当先验,规则/符号能量当约束,解决幻觉。
  4. LLM 模拟器:纯文本状态转移的下限与玩具——以及它为什么不够当主路径。

旧版把 LLM 章放在附录。现在它是路径五的接口层,不再假装自己能替代前三条视觉路径。


四、和路径三、四的边界

  • 路径三:都可以规划。路径三的 z 不可读;路径五的 s 可打印、可验证、常更省数据,但开放视觉弱。
  • 路径四:符号规则很容易表达 do(删一条 effect);但规则学错了,干预语义也一起错。因果阶梯问的是「你的数据能不能支撑这句话」。
  • AgentOWL(Piriyakulkij et al., 2026)在 Atari 上联合学层级 option 与抽象世界模型,夹在路径三(抽象状态)与路径五(可组合技能的符号图)之间,下一章程序化部分会点到。

五、代码

本章 demo.py 用一个「钥匙—门」微缩世界对比:显式规则执行器 vs 只记训练转移的查找表。后者在训练分布上完美,换一把没见过的钥匙就崩——这就是「神经记忆 ≠ 符号定律」的最小演示。

下一章从像素接地开始:从像素到谓词

📥 Code

FileViewDownload
demo.pyOpenDownload
exercise.pyOpenDownload

参考

  1. LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence.(世界模型作为自主智能核心模块)
  2. Berg, J., et al. (2025). Semantic World Models. [arXiv:2510.19818]
  3. Craik, K. (1943). The Nature of Explanation.(内部小尺度模型)
  4. 本路径其余引用见随后三章。