LLM 即世界模型:从离散 token 到连续状态的范式回归
2026-06-29 · 4 篇新论文集中讨论同一核心问题
为什么重要:过去 4 年,"LLM 是不是世界模型"这个问题反复撕裂社区:LeCun 在 2022 年公开宣称自回归 token 预测不可能通向 AGI,必须用 JEPA 之类的潜空间架构;而 Yann Dubois、Andrej Karpathy 等人则坚持 LLM 通过压缩文本已经隐式建模了世界。今天 ArXiv 一次性出现了 3-4 篇立场明确、互为参照的论文,把这场争论从口水战推进到可训练的中间形态——多 token 预测、潜空间预测、未来摘要预测都站住了脚。这不是理论分歧,而是工程路线之争。
核心判断:"LLM vs 世界模型"从来不是非此即彼。LLM 是世界模型的一个退化的特殊形态——状态空间是所有 token 序列,唯一动作是 append 一个 token。沿着连续谱移动,每一步都松开一个约束,但同时失去一项 LLM 之所以能 scale 的优势(互联网自监督数据 + 为离散 token 联合设计的 transformer)。
核心论文解读
① From Tokens to States: LLMs as a Special Case of World Models (arXiv:2606.28127)
Paul Dubois理论立场cs.CL
- 核心论点:反驳二元对立。LLM 的状态空间 = 所有 token 序列,动作为"追加一个 token",因此世界模型是 LLM 的严格泛化(而非替代)。
- 关键中间形态:作者画出一条从 NTP → multi-token prediction → future-summary prediction → next-latent prediction → JEPA 的连续谱,每一站都对应着已有的研究方向。
- 两大未解问题:(1) 数据悬崖——从互联网自监督文本到带动作标注的具身环境,中间断层无解;(2) 架构问题——transformer 能不能泛化到连续状态预测,还是必须发明新原语。
- 局限性:10 页短文,理论梳理性质,无新实验。把争论从"信仰之争"翻译成"工程取舍清单"是真正的贡献,但没回答谱上哪个点 sweet spot。
② Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (arXiv:2606.27483)
Xuan Zhang et al. (Fudan / 翌识智能)Agent 训练cs.AI
- 动机:LLM agent 在长时任务上本质是 reactive 的,没有内部世界模型做"what-if"评估。
- 核心方法:训练单个自回归模型同时verbalize 未来状态 rollout和plan-conditioned success estimate(Q-value 的文本类比)。
- 三阶段训练 pipeline:(1) WM-AMT 中训练注入潜在预测能力;(2) FE-SFT 把这种能力结构化成可监督的格式;(3) FC-RL 校准 generated simulations 的实用性。
- 关键洞察:作者识别出 format-capability gap——简单对 agent 做 look-ahead trace 的 SFT,只能学到"模仿有先见之明",没有真正的预测能力。必须先注入 capability,再 format,再 RL。
- 局限性:评估局限于搜索和数学推理任务,泛化到 embodied / 多模态未知;verbalized rollout 在长 horizon 累积误差问题未充分讨论。
③ Grounded Iterative Language Planning (GILP, arXiv:2606.27806)
Xinyuan Song, Zekun Cai参数化世界模型cs.AI
- 对比框架:把语言 agent 的世界模型分为两类——(a) agent-based(调 LLM API 在语言空间灵活推理,但错误是幻觉化状态变化,难以用回归损失度量);(b) parameterized(训练转移预测器,错误易测但作为独立 planner 较弱)。
- 方法:训练小型 parameterized backbone,提供 valid actions / state deltas / risk / value;LLM 起草 action 和想象的 delta;consistency gate在两者不一致时触发 revision。
- 实测结果:在 GPT-4o-mini 上,hallucinated-state rate 从 0.176 降到 0.035(5× 改善);calibrated simulator ablation 中 success 从 0.668 提到 0.838,LLM 调用只增加 22%。
- 局限性:仅在 4 个 graph-structured planning 基准上验证;parameterized backbone 在 text/structured state 之外的迁移性未证明。
④ Understanding Rollout Error in Graph World Models (arXiv:2606.27780)
Xinyuan Song, Zekun Cai诊断研究cs.AI
- 贡献:与 GILP 互补,专门分析 graph world model rollout 错误的来源和传播模式。
- 价值:为③号论文提供理论支撑——如果不知 rollout error 模式,consistency gate 的阈值无从选择。
相关工作
| 方向 |
代表工作 |
核心思路 |
| JEPA 路线 |
LeCun 2022; V-JEPA 2 (Meta 2025) |
潜空间预测,去掉离散化 |
| Multi-token prediction |
Gloeckle et al. (Meta, 2024) |
NTP 的一阶推广,谱上的第二站 |
| Process reward / Tree-of-Thought |
SnT / ToT 系列 |
显式 verbalize 中间状态,可视为谱上的未来摘要预测 |
| RL with Verifiable Rewards |
arXiv:2606.28166 (Tandem RL) |
同一窗口期,强调在 verify-able 任务上 RL 训练 |
| Agentic SFT+RL 范式 |
Skywork-OR1, DeepSeek-R1 等 |
工程上验证了"格式 + 强化"两阶段 |
注意:①号论文作者 Paul Dubois 是单人 short paper,立场性强但实验弱。它的价值是把辩论术语统一,不是给出 SOTA;拿它和 LeCun 公开辩论要小心样本量问题。②号 Fudan 工作作者里有 Xiaoyu Tan / Yuan Qi(翌识智能),是国内一线 agent 团队,可信度高,但评估范围窄。
我的判断
- LLM 即世界模型这个命题基本成立,Dubois 的形式化把口水仗转成了可分析的谱。短期内不会有"替代 LLM" 的方案出现,但 next-latent prediction 会成为新的研究密集区。
- 最有工程落地价值的是 GILP 的 hybrid 路线(parameterized backbone + LLM API + consistency gate):5× hallucination 降低、22% LLM 调用增量,对所有做 agent 的团队都有借鉴价值——只要你能训出一个小转移预测器。这条路径避开了 LeCun/Dubois 的二元对立。
- "format-capability gap" 是个被低估的概念(②号论文的核心洞察):很多团队 SFT agent 时以为学到 reasoning,其实只学到 surface format。WM-AMT → FE-SFT → FC-RL 三阶段框架值得复用到任何"复杂推理 RL"任务。
- 数据悬崖是真问题,不是工程问题。Dubois 提的两个开放问题里,data cliff 更难——互联网文本和具身环境的标注密度差几个数量级,没有捷径。
- 对 JC 的实际意义:如果做 picturebook-kg 这类知识图谱应用,LLM + 外部 KG 充当 parameterized world model 已是主流;本期的 GILP 思路可以直接借鉴——在生成绘本实体/关系时,让一个小的 KG transition predictor 守门,比纯 prompt LLM 稳得多。
一句话总结:今天的 ArXiv 给"LLM 是不是世界模型"这场 4 年争论画了一条可走的连续谱,hybrid(parameterized + LLM API + consistency gate)是当下最优工程解;下个研究爆发点会在 next-latent prediction。