今天 arXiv cs.AI / cs.CL 新文里,最值得拆开的不是又一个「更长 CoT」,而是同一条诊断:局部看起来对,并不等于规划时能把候选分开。稀疏终局奖励会把策略吸向易采样的局部合法分支;事实下一状态误差很低的世界模型,仍可能给所有动作同一个代价。
结论:规划用的量是「候选之间、且能延伸到成功的差异」,不是轨迹似然,也不是事实预测误差。SAGE 用代数稀疏化 + 双曲深度信号去压长程偏置;AD-WM 用动作可恢复约束,让潜空间转移保留反事实比较所需的动作信息。两者都把结构先验注进训练,测试时不改规划器本身。
Agent 和机器人规划现在默认两件事:结果奖励够稀也没关系,过程监督或更强的下一状态预测会补上;模型给出的概率可以直接当路由接口。9 月 24 日提交、今日进入 recent 列表的两篇工作,分别在符号长程推理和视觉模型预测控制上打穿了这两个默认。
若诊断成立,加长思维链、加 dense judge、或把世界模型的 MSE 再压低,都可能优化错目标。该问的是:这条轨迹还能不能延伸,这个潜转移还能不能把「靠近目标」和「离开目标」分开。
arXiv:2609.30192 · Xinyue Zeng, Jiawei Zhang, Yujun Yan, Dawei Zhou · NeurIPS 2026 · 代码 Susan571/SAGE-NeurIPS2026
论文把长程推理写成带局部可采纳谓词 Adm 的有限时域 MDP。可达体积按平均分支因子指数膨胀,|Ω| = O(Ā^T),成功轨迹只占其中一条越来越窄的流形;有信息的监督往往只在终点,r(τ) = 1[τ ∈ T*]。在这个几何里,结果型后训练会稳定地产生两种偏置。
∇J ≈ −β ∇D_KL(πθ ‖ π_ref),等于在保住参考策略,而不是在修正任务结构。他们的理论镜头叫 Symbolic Closure Analysis(SCA)。可行集不是「参考策略概率高于 ε 的轨迹」(那只保留易采样的),而是前缀闭合的局部可采纳闭包:每一步都满足 Adm(s_t, a_t, s_{t+1})。显式符号系统里这个闭包是精确的;闭式数学里用未消变量和答案模式当代理;自由文本里则从提示条件的语义结构估计残差和锚点。SCA 因此是诊断,也是往非形式任务迁移时的设计原则,不是只在群论题上成立的技巧。
SAGE(Structural Admissibility-Guided Exploration)把这个诊断做成两条互补的结构引导,注入策略优化,而不是外挂一个逐步 verifier:
跑题例子是 Andrews-Curtis 平凡化:用逆元、乘关系子、共轭等合法变换,把群表示化成平凡表示。很多步局部合法,只有少数步会持续简化剩余代数结构。这正是过程监督昂贵、而结构先验便宜的场景。
实验覆盖 7 个模型族、12 个基准,含闭式数学、自由形式自然推理,以及开放长程任务。论文报告相对竞争性基线全面更好,在 Andrews-Curtis 上最高约 8 倍。我没有在截断的 HTML 里看到逐基准完整表,因此 8 倍应读成「带显式可采纳性的开放长程任务上的上界改进」,不要外推成通用数学题 8 倍。
读 SAGE 时不要滑过去的点:它明确拒绝「用更密的过程标签解决稀疏奖励」。过程监督把瓶颈从采样移到标注,并不改变可行支撑被高体积无效分支稀释这一几何事实。若你的任务没有可计算的局部可采纳性或残差代理,SAGE 的第三条实例化(自由文本估计残差)还没有被这篇摘要级证据单独钉死。
arXiv:2609.30264 · Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo, Yang Gao · 项目页 ad-wm.github.io
潜世界模型通常拟合「实际发生的那条转移」。模型预测控制(MPC)要的是另一件事:从同一状态出发,比较没发生的动作。一个与动作无关的预测器 F0(z, a) = z,在增量很小时事实误差只有 E‖δ_t‖²,却给所有动作序列同一个终端代价。低 MSE 可以完全掩住规划需要的差异。
AD-WM 是面向反事实 MPC 的动作可区分联合嵌入世界模型。训练时三件事一起塑造转移,测试时辅助头全部丢掉,CEM 规划器不改:
仿真里编码器与预测器联合训练(带 SIGReg)。机器人后训练冻结 V-JEPA 2 编码器、去掉 SIGReg,与 DROID 后训练对齐。部署时 CEM 用终端代价 ‖ẑ_{t+H} − z_g‖² 打分,执行第一个动作块再重规划。
他们另外指出一个评测陷阱:模型可以把大部分候选排对,同时判错 CEM 会留下的 elite 集。所以他们用环境真实结果,在共享候选序列上算与规划对齐的 elite regret。在受控 Cube 实验里,事实预测误差和全库动作排序都不跟随闭环成功率,elite regret 更接近。
| 设置 | 对比 | 结果 |
|---|---|---|
| OGBench-Cube hard-start | 对匹配的 LeWM | 3.7% → 52.0% |
| 五个仿真环境平均成功 | 复现的 LeWM | 五个里四个提升,不是五个全胜 |
| Franka 零样本抓放 | 冻结 V-JEPA 2,匹配 DROID 后训练,无实验室适配 | 42.2% → 71.1% |
和 Delta-JEPA 的差别要写清楚:Delta-JEPA 从观测到的潜位移恢复动作;AD-WM 的逆动力学和归一化恢复默认作用在预测转移上。规划器比较的是模型自己滚出来的未来,不是数据集里已经发生的下一步。只约束观测转移,反事实分支仍然可以塌成同一个表征。
两篇论文的公分母:SAGE 说「易采样的局部合法轨迹」不是可行支撑;AD-WM 说「事实下一状态误差」不是反事实可分性。优化目标必须直接碰到规划时要比较的那个量。
同一天列表里,还有几篇把「比较」放在不同接口上。它们不够成第二主线,但能标出这条诊断的边界。
| 论文 | 在比什么 | 和主线的关系 |
|---|---|---|
| GRASP 2609.30147 REALM @ EMNLP 2026 | 宏指南 GenPlan、隔离上下文里的局部策略 RevPlan、独立判别器 VerPlan | 也是把规划拆开、避免一条上下文里既探索又自证。报告 Natural Plan 日历约 +12.4%,ZebraLogic 约 +30.8%,交错双任务绝对 +16.7%,并称相对 GPT-5-mini +14.5%。车间论文,前沿模型对照当作者声称,不当独立复现。 |
| ExplorationBench 2609.30199 | 可执行、且与常识冲突的 Alien Worlds:AlienCode 31 个发现目标 / 70 任务,AlienLogic 24 / 70 | 把「探索」从「回忆预训练」里拆出来。最强系统能习得陌生规则,但轨迹方差大,继续探索可能停滞甚至逆转早期收益。对应 SAGE 的探索偏置:多走不等于走在可延伸分支上。 |
| JevOut 2609.30243 代码 xzx34/JevOut | 决策模型把语言直接映射成有限选项上的概率 | 508 个原本正确的决策里,312 个(61.4%)被短的、自然的上下文加成翻到固定错误项;其中 229 个错误项概率 ≥ 0.7。另外三个决策系统在各自原本正确的决策上,定向翻转率 64.9%–73.2%。概率输出不是稳定的比较接口。 |
| VeriSpeak 2609.30227 EMNLP 2026 Main | 3,879 条口语声称上的检索增强事实验证 | 文本上能核验的模型,同一声称换成语音就失败。只检索增益有限,因为模型把证据和声称搅在一起;检索加显式推理后,thinking-tuned LALM 到 86.1%。又是「多了信息」不够,必须有可执行的比较步骤。数据:abhiram4572/VeriSpeak。 |
稍早、但仍在本周推理检索里的相关工作,可作背景而不是今日主文:2609.27041 认为数学推理的内部计算按「解法」而不是「题目主题」组织;2609.27038 用激活修补问stated CoT 步骤是否因果承重;2609.24710 在网络安全分析里比较线性 / 分支 / 图推理拓扑,图拓扑增益最大。它们和 SAGE 同向:结构怎么组织,比表面步骤长不长更决定能否延伸。
若只留一条给做 agent 的人:不要用「下一步看起来对」当规划质量的代理指标。 具体三条。
证据边界:SAGE 的 8 倍来自 Andrews-Curtis 这类有显式算子的开放长程任务,自由文本实例化的收益我没有从全文表里逐项核对。AD-WM 是 4/5 仿真环境提升,不是全胜;Franka 数字是零样本抓放,不是通用操作。GRASP 对 GPT-5-mini 的 14.5% 是车间论文自述。Papers with Code 今日超时,星标未核;入选依据是 NeurIPS / EMNLP Main,或新方法且给出代码,不是社区热度。
下一周若只跟一篇,跟 SAGE 的逐基准表:代数稀疏化和双曲引导各自消融后,自由形式推理还剩多少。若消融只在 AC 上显著,这条结构先验就还停在符号界面,不能直接搬进通用 agent 的过程奖励。