Skip to content

LLM 作为世界模型:接口层,不是整条路径

WARNING

🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。

把状态与动作写成文本,下一 token 预测就变成世界模型。这是路径五最容易上手、也最容易被高估的一层。主线见 路径五导论;规则对齐见 WALL-E / NeSyS


一、LLM 能不能当世界模型?

Pθ(st+1textsttext,attext)

与下一 token 预测同构。优势是可解释、常识强、组合泛化;劣势是连续物理弱、易幻觉、长程实体易漂、传感器接地难。

逐步说明:文本状态转移为何不够当主路径(点击展开)

stext 是字符串。下一步是续写。实体「杯子」在第 20 步可能被模型忘掉或改名,没有指针保证同一对象。连续角度、摩擦没有稳定的数值积分。它适合当接口(把规划意图说出来、写 PDDL),或当玩具模拟器。主路径仍应是视觉/潜空间/符号执行器之一;LLM 层负责翻译和补全,不负责当物理引擎。

LLM 作为世界模型

和路径四的接点:Language Agents Meet Causality 一类工作把 LLM 智能体接到显式因果世界模型。和路径五其余章的接点:Text2World 要 LLM 写 PDDL,WALL-E 要 LLM 服从学来的规则——都比「让模型自由续写下一状态」更可验证。

经典文献还包括 Hao et al.(2023)Reasoning with Language Model is Planning with World Model(RAP:用 LM 当推演器做 MCTS 式推理)以及 Wong et al.(2023)From Word Models to World Models


二、五路径 + 语言接口(总表)

路径核心思想预测什么决策代表
一 视频生成观测级生成像素/视频潜空间弱–中(贵)GAN→VAE→扩散→Sora/Cosmos
二 交互/3D可玩/可漫游动作条件帧或 3D中(交互强)Genie、HunyuanWorld
三 抽象状态紧凑动力学z/嵌入PETS、Dreamer、JEPA、LeWM、MuZero
四 因果干预与反事实P(do)取决于识别LLM-CWM、NTP 因果分析
五 符号/神经符号谓词、规则、程序可执行符号状态高(可搜索)pix2pred、PoE-World、WALL-E、NeSyS
本章 语言接口文本状态转移token中(易幻)LLM simulators、RAP

经验法则:

  • 刷视觉先验 / 数据 → 路径一;
  • 要可玩舞台 → 路径二;
  • 要样本高效控制 → 路径三;
  • 要区分「看见」与「动手」→ 路径四;
  • 要可检查定律 / 少样本组合 → 路径五;
  • 只要常识与工具编排 → 语言接口,并最好接到因果模块或符号规则。

三、玩具

本章 demo 仍是钥匙与门的微缩文本世界:字符嵌入 + MLP 学转移,展示语言状态可学、也会局部幻觉。对照 路径五导论 的规则执行器:一边是「记住训练句子」,一边是「执行定律」。

四、小结

五路径是骨干;LLM 是接口与常识层。建议回到 导论 按应用选题,或把规则对齐读完 WALL-E

📥 Code

FileViewDownload
demo.pyOpenDownload
exercise.pyOpenDownload

参考

  1. Hao, S., et al. (2023). Reasoning with Language Model is Planning with World Model. [arXiv:2305.14992]
  2. Wong, L., et al. (2023). From Word Models to World Models. [arXiv:2306.12672]
  3. Gkountouras, J., et al. (2025). Language Agents Meet Causality. ICLR.
  4. Zhou, S., et al. WALL-E / WALL-E 2.0(规则与神经符号对齐)。