超越 Chain-of-Thought — 2026 年高效推理的新架构与新方法
2026-07-17 · ArXiv cs.AI / cs.CL 深度调研
为什么重要:Chain-of-Thought (CoT) 仍然是当前 LLM 推理的默认范式,但 2026 年 7 月这一周 arXiv 上出现了三篇代表性工作,分别从架构层、训练层、交互层三个维度尝试绕过或改进 CoT——T²MLR 用中间层循环实现潜在推理,Mask-Aware Policy Gradients 把 RL 拓展到 Masked Diffusion LM,Deep Interaction 让人直接编辑推理链。三者叠加意味着「推理」这个核心能力正在从「提示技巧」迁移到「系统能力」,这是 2026 下半年的关键拐点。
核心论文解读
1. T²MLR — 中间层时序循环,让 Transformer 在 token 空间之外思考
arXiv:2607.15178新架构潜在推理
作者:Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora (Princeton)
核心动机:自回归解码每一步都把中间计算「压缩回 token 空间」,这导致中间推理状态难以跨时间步持续存在——CoT 是用显式 token 来缓解这个问题,但代价是大量的解码开销。
关键设计:
- 把 Transformer 的某一中间层(默认中段)在上一 token 位置的隐藏表示缓存下来
- 在当前 token 的更早一层(earlier layer)融合这个 cached representation
- 让「抽象的中间计算」在解码步之间直接传递,不经过 token 离散化
反直觉的发现:只对 20% 的中间层做 recurrence 反而比「全层循环」更好——说明 latent reasoning 不需要在所有层反复迭代,「定点循环」是错的假设,「中段定点」才是对的。
实用性:不需要从头预训练。直接把循环通路 retrofit 到一个 1.7B 已预训练 Transformer 上,短暂微调就能显著提升数学推理。
局限性:
- 论文主要在 1.7B 规模验证,10B+ 是否仍然「中段定点最优」未知
- Recurrence 路径的 cache 长度与显存 trade-off 没有完整讨论
- 与 MoE / 长上下文(>128K)架构的兼容性未涉及
2. Mask-Aware Policy Gradients — 让 RL 真正作用在扩散语言模型上
arXiv:2607.15200COLM 2026新方法扩散 LM
作者:Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl (UT Austin)
核心动机:Masked Diffusion Language Models (MDLM) 的对数似然 intractable,之前的 RL 工作要么忽略 unmasking 顺序,要么只能用 token-only 的策略梯度,丢失了扩散模型「先验分布强、可并行解码」的优势。
关键洞察:MDLM 每一步涉及两个决策——「在 mask 位置放什么 token」+「下一步 remask 哪些位置」。论文把这两步显式建模为一个 two-stage action MDP。
公式分解:
- 策略梯度自然分解为 token term(内容选择)+ masking term(位置选择)
- 联合优化两个 term → 状态最优
实证结果:
| Benchmark | 分数 | 对比 |
| GSM8K | 87.1% | 新 SOTA on MDLM |
| MBPP | 53.4% | 显著超过此前最佳 |
为什么这是拐点:
- 扩散 LM 一直被「能不能上 RL」卡住,这篇把通路打通
- 「token + masking」双决策建模可以推广到其他离散扩散场景(图像、code、protein)
- COLM 2026 venue(Conference on Language Modeling)是首个专注 LM 本身的顶会,选址有信号意义
局限性:
- GSM8K / MBPP 仍是 narrow benchmark,数学证明、长链推理未验证
- Masking term 的梯度方差是否可控没讨论清楚——RL 经典坑
- 代码暂未公开(论文刚出),可复现性待观察
3. Deep Interaction — 直接编辑推理链,25% 修正成功率提升
arXiv:2607.14049新方法Human-AI 协作
作者:Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li
核心痛点:当前 LLM 推理出错时,用户的标准操作是「指出哪步错了」,模型礼貌回复「You're right, I made a mistake here」然后给出「另一个类似的错误」——因为它实际上没有真正修正推理路径,只是在 token 层面「承认错误」。
关键设计:
- 让用户直接编辑原 response 中错误的部分(不是写新 prompt)
- 保留已正确的推理步骤
- 把编辑后的 CoT 蒸馏为一个新 prompt,引导模型沿修正路径继续推理
实验结果(STEM 任务):
为什么这篇值得研究:
- 「对话式纠错」的失败模式是 2026 年 LLM 在长任务(代码、debug、研究)中的核心瓶颈
- 40% token 节省暗示「让模型重新生成整个 CoT」本身就是浪费
- 蒸馏为 prompt 的思路可以推广到 agent harness 的纠错机制设计
局限性:
- 需要用户介入,自动化程度低
- 「用户编辑」的质量直接影响效果,没有评估 worst-case 编辑
- 只验证 STEM 任务,长形式写作、创意任务未涉及
相关工作
- LAPO (arXiv:2607.13501, Qiang Zhu & Jiajun Wu) — Leave-One-Turn Attribution 提出反向 leave-one-turn 的 process reward,无需额外奖励模型/verifier,在 7 个 KBQA 数据集上 EM 0.326,超过 IGPO 5.3 个点。与 Deep Interaction 互补:LAPO 是「机器自评每步贡献」,Deep Interaction 是「人介入纠错」。
- Experience Memory Graph (arXiv:2607.13884, Wenjun Wang et al.) — One-shot error correction for agents,把错误经验沉淀为图结构,本质是 Deep Interaction 的「自动化版本」。
- CAVA (arXiv:2607.13716, Zexun Wang) — Canonical Action Verification for agent 运行时治理,与 Deep Interaction 同属「agent 可控性」主题,但 CAVA 关注「动作验证」,Deep Interaction 关注「推理链修正」。
- Harness Handbook (arXiv:2607.13285, Ruhan Wang et al.) — Making Evolving Agent Harnesses Readable — 从工程角度反思 agent harness 设计,呼应 Deep Interaction 暴露的「提示工程粗糙」问题。
共同信号:2026 年 7 月这一周 arXiv 上的 agent/推理类论文,共同信号是「显式 CoT 的边际收益在递减」——研究者开始把推理能力往架构层(T²MLR)、训练层(MDLM+RL)、交互层(Deep Interaction)三个更深的地方推。LLM 推理从「提示技巧时代」过渡到「系统能力时代」的拐点,可能就是 2026 Q3。
我的判断
1. 投资视角:这周论文里最值得 follow 的不是单独某篇,而是三篇叠加揭示的趋势——如果只选一篇跟到底,我会选 T²MLR:它对已部署模型 retrofit 的成本最低、对 reasoning benchmark 的提升最稳定、最容易从论文跑到生产(1.7B retrofit + 短期微调 = 一张 H100 跑几天)。如果只看 SOTA 数字,Mask-Aware PG 那篇 87.1% GSM8K 值得 benchmark。
2. 对独立开发者的实际意义:Deep Interaction 这篇对 agent 工程最直接——它点出了一个我们做 agent harness 时反复踩的坑:「让 LLM 重新生成整个 CoT」是反效率的。正确的设计应该是「保留正确部分 + 编辑错误部分 + 蒸馏为新 prompt」。这对 OpenClaw 这类 agent harness 的纠错机制有直接借鉴价值。
3. 潜在风险:三篇论文都在「推理效率」轴上发力,但没有一篇认真讨论 reasoning faithfulness——更快、更短的推理路径是否意味着更不可解释?T²MLR 把推理压到 latent 空间,Deep Interaction 让用户编辑 CoT,这都让 reasoning 的可审计性变差。2026 下半年可能会出现「高效推理 vs 可解释推理」的 tradeoff 议题,值得提前布局。
4. 可复现性预警:T²MLR 和 Mask-Aware PG 都暂未公开完整代码(论文刚出)。如果要做技术选型,等 2-3 周再看代码仓库和社区复现报告,不要急着跑 benchmark。
参考链接