LLM 即世界模型:从离散 token 到连续状态的范式回归

2026-06-29 · 4 篇新论文集中讨论同一核心问题

为什么重要:过去 4 年,"LLM 是不是世界模型"这个问题反复撕裂社区:LeCun 在 2022 年公开宣称自回归 token 预测不可能通向 AGI,必须用 JEPA 之类的潜空间架构;而 Yann Dubois、Andrej Karpathy 等人则坚持 LLM 通过压缩文本已经隐式建模了世界。今天 ArXiv 一次性出现了 3-4 篇立场明确、互为参照的论文,把这场争论从口水战推进到可训练的中间形态——多 token 预测、潜空间预测、未来摘要预测都站住了脚。这不是理论分歧,而是工程路线之争。

核心判断:"LLM vs 世界模型"从来不是非此即彼。LLM 是世界模型的一个退化的特殊形态——状态空间是所有 token 序列,唯一动作是 append 一个 token。沿着连续谱移动,每一步都松开一个约束,但同时失去一项 LLM 之所以能 scale 的优势(互联网自监督数据 + 为离散 token 联合设计的 transformer)。

核心论文解读

① From Tokens to States: LLMs as a Special Case of World Models (arXiv:2606.28127)

Paul Dubois理论立场cs.CL

② Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (arXiv:2606.27483)

Xuan Zhang et al. (Fudan / 翌识智能)Agent 训练cs.AI

③ Grounded Iterative Language Planning (GILP, arXiv:2606.27806)

Xinyuan Song, Zekun Cai参数化世界模型cs.AI

④ Understanding Rollout Error in Graph World Models (arXiv:2606.27780)

Xinyuan Song, Zekun Cai诊断研究cs.AI

相关工作

方向 代表工作 核心思路
JEPA 路线 LeCun 2022; V-JEPA 2 (Meta 2025) 潜空间预测,去掉离散化
Multi-token prediction Gloeckle et al. (Meta, 2024) NTP 的一阶推广,谱上的第二站
Process reward / Tree-of-Thought SnT / ToT 系列 显式 verbalize 中间状态,可视为谱上的未来摘要预测
RL with Verifiable Rewards arXiv:2606.28166 (Tandem RL) 同一窗口期,强调在 verify-able 任务上 RL 训练
Agentic SFT+RL 范式 Skywork-OR1, DeepSeek-R1 等 工程上验证了"格式 + 强化"两阶段
注意:①号论文作者 Paul Dubois 是单人 short paper,立场性强但实验弱。它的价值是把辩论术语统一,不是给出 SOTA;拿它和 LeCun 公开辩论要小心样本量问题。②号 Fudan 工作作者里有 Xiaoyu Tan / Yuan Qi(翌识智能),是国内一线 agent 团队,可信度高,但评估范围窄。

我的判断

  1. LLM 即世界模型这个命题基本成立,Dubois 的形式化把口水仗转成了可分析的谱。短期内不会有"替代 LLM" 的方案出现,但 next-latent prediction 会成为新的研究密集区。
  2. 最有工程落地价值的是 GILP 的 hybrid 路线(parameterized backbone + LLM API + consistency gate):5× hallucination 降低、22% LLM 调用增量,对所有做 agent 的团队都有借鉴价值——只要你能训出一个小转移预测器。这条路径避开了 LeCun/Dubois 的二元对立。
  3. "format-capability gap" 是个被低估的概念(②号论文的核心洞察):很多团队 SFT agent 时以为学到 reasoning,其实只学到 surface format。WM-AMT → FE-SFT → FC-RL 三阶段框架值得复用到任何"复杂推理 RL"任务。
  4. 数据悬崖是真问题,不是工程问题。Dubois 提的两个开放问题里,data cliff 更难——互联网文本和具身环境的标注密度差几个数量级,没有捷径。
  5. 对 JC 的实际意义:如果做 picturebook-kg 这类知识图谱应用,LLM + 外部 KG 充当 parameterized world model 已是主流;本期的 GILP 思路可以直接借鉴——在生成绘本实体/关系时,让一个小的 KG transition predictor 守门,比纯 prompt LLM 稳得多。
一句话总结:今天的 ArXiv 给"LLM 是不是世界模型"这场 4 年争论画了一条可走的连续谱,hybrid(parameterized + LLM API + consistency gate)是当下最优工程解;下个研究爆发点会在 next-latent prediction。