超越 Chain-of-Thought — 2026 年高效推理的新架构与新方法

2026-07-17 · ArXiv cs.AI / cs.CL 深度调研

为什么重要:Chain-of-Thought (CoT) 仍然是当前 LLM 推理的默认范式,但 2026 年 7 月这一周 arXiv 上出现了三篇代表性工作,分别从架构层、训练层、交互层三个维度尝试绕过或改进 CoT——T²MLR 用中间层循环实现潜在推理,Mask-Aware Policy Gradients 把 RL 拓展到 Masked Diffusion LM,Deep Interaction 让人直接编辑推理链。三者叠加意味着「推理」这个核心能力正在从「提示技巧」迁移到「系统能力」,这是 2026 下半年的关键拐点。

核心论文解读

1. T²MLR — 中间层时序循环,让 Transformer 在 token 空间之外思考

arXiv:2607.15178新架构潜在推理
作者:Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora (Princeton)

核心动机:自回归解码每一步都把中间计算「压缩回 token 空间」,这导致中间推理状态难以跨时间步持续存在——CoT 是用显式 token 来缓解这个问题,但代价是大量的解码开销。

关键设计:

反直觉的发现:只对 20% 的中间层做 recurrence 反而比「全层循环」更好——说明 latent reasoning 不需要在所有层反复迭代,「定点循环」是错的假设,「中段定点」才是对的。

实用性:不需要从头预训练。直接把循环通路 retrofit 到一个 1.7B 已预训练 Transformer 上,短暂微调就能显著提升数学推理。

局限性:

2. Mask-Aware Policy Gradients — 让 RL 真正作用在扩散语言模型上

arXiv:2607.15200COLM 2026新方法扩散 LM
作者:Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl (UT Austin)

核心动机:Masked Diffusion Language Models (MDLM) 的对数似然 intractable,之前的 RL 工作要么忽略 unmasking 顺序,要么只能用 token-only 的策略梯度,丢失了扩散模型「先验分布强、可并行解码」的优势。

关键洞察:MDLM 每一步涉及两个决策——「在 mask 位置放什么 token」+「下一步 remask 哪些位置」。论文把这两步显式建模为一个 two-stage action MDP。

公式分解:

实证结果:

Benchmark分数对比
GSM8K87.1%新 SOTA on MDLM
MBPP53.4%显著超过此前最佳

为什么这是拐点:

局限性:

3. Deep Interaction — 直接编辑推理链,25% 修正成功率提升

arXiv:2607.14049新方法Human-AI 协作
作者:Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

核心痛点:当前 LLM 推理出错时,用户的标准操作是「指出哪步错了」,模型礼貌回复「You're right, I made a mistake here」然后给出「另一个类似的错误」——因为它实际上没有真正修正推理路径,只是在 token 层面「承认错误」。

关键设计:

实验结果(STEM 任务):

为什么这篇值得研究:

局限性:

相关工作

共同信号:2026 年 7 月这一周 arXiv 上的 agent/推理类论文,共同信号是「显式 CoT 的边际收益在递减」——研究者开始把推理能力往架构层(T²MLR)、训练层(MDLM+RL)、交互层(Deep Interaction)三个更深的地方推。LLM 推理从「提示技巧时代」过渡到「系统能力时代」的拐点,可能就是 2026 Q3。

我的判断

1. 投资视角:这周论文里最值得 follow 的不是单独某篇,而是三篇叠加揭示的趋势——如果只选一篇跟到底,我会选 T²MLR:它对已部署模型 retrofit 的成本最低、对 reasoning benchmark 的提升最稳定、最容易从论文跑到生产(1.7B retrofit + 短期微调 = 一张 H100 跑几天)。如果只看 SOTA 数字,Mask-Aware PG 那篇 87.1% GSM8K 值得 benchmark。
2. 对独立开发者的实际意义:Deep Interaction 这篇对 agent 工程最直接——它点出了一个我们做 agent harness 时反复踩的坑:「让 LLM 重新生成整个 CoT」是反效率的。正确的设计应该是「保留正确部分 + 编辑错误部分 + 蒸馏为新 prompt」。这对 OpenClaw 这类 agent harness 的纠错机制有直接借鉴价值。
3. 潜在风险:三篇论文都在「推理效率」轴上发力,但没有一篇认真讨论 reasoning faithfulness——更快、更短的推理路径是否意味着更不可解释?T²MLR 把推理压到 latent 空间,Deep Interaction 让用户编辑 CoT,这都让 reasoning 的可审计性变差。2026 下半年可能会出现「高效推理 vs 可解释推理」的 tradeoff 议题,值得提前布局。
4. 可复现性预警:T²MLR 和 Mask-Aware PG 都暂未公开完整代码(论文刚出)。如果要做技术选型,等 2-3 周再看代码仓库和社区复现报告,不要急着跑 benchmark。

参考链接