为什么重要。2025 年的推理范式核心是「思维链 + 同采样自洽」,2026 年上半年的进展已经收敛到三个新方向:用异质智能体替代同质采样、用统计过程监控在推理途中主动回溯、把历史解法提炼成可检索的经验库。今天的三篇新论文正好对应这三条路线,且都给出了可复现的实证。
论文:Test-Time Reasoning inspired by Cognitive Heterogeneity · Anmol Kankariya 等 · TMLR 2026 · TMLRHLE SOTA
核心思路。作者观察到当前主流推理增强方法(Best-of-N、Self-Consistency、Majority Voting)本质都是「同质采样 + 聚合」,浪费了算力却没有引入真正的认知差异。PoTRE 把推理拆成四个异质智能体并行跑:
最后用一个 Task-Adaptive Aggregation Layer 动态决定怎么融合:可以是投票、可以是语义综合、也可以触发神经符号验证。
结果。在 HLE(Humanity's Last Exam)上拿到 49.92% 准确率,刷新官方榜单纪录。更值得注意的是 ARC-AGI-2 和 PRBench Finance 上均报告「用相似或更少 token 超越同质基线」——也就是异质性本身带来了信息密度收益,不只是「算力换性能」。
论文:CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning · MATH-500小模型
核心思路。作者关注量化小模型在长推理中容易陷入「重复循环 + 退化轨迹」的痛点——推理 token 烧了,但输出在原地打转。MGT-B 的设计是:
h = 10 时报警。结果。在 240 对 chronology-audit 的 MATH-500 题目上,准确率从 82/240 提升到 88/240(+2.50pp,McNemar p = 0.2632,不显著);在 467 对历史覆盖集上从 146/467 到 167/467(+4.50pp,p = 0.000753,显著)。关键发现:151 个报警轨迹里有 29 个修正 + 8 个回归——监控是「选择性」的,不是粗暴重做。
论文:Notes to Self: Can LLMs Benefit from Experiential Abstractions? · Chang Liu 等 · 类人学习检索增强
核心思路。人类解题会提炼出「这类题先这样想」「小心这类坑」的抽象经验。论文问:LLM 也能这样做吗?流程是:
结果。在数学和逻辑推理基准上都带来提升,且 self-extracted 的抽象效果与 teacher-extracted 几乎持平——意味着不需要更贵的 teacher,模型自己就能蒸馏出可用经验。框架可迁移到其他数据集和模型。
| 维度 | PoTRE(异质) | MGT-B(监控) | Experiential Abstr.(检索) |
|---|---|---|---|
| 干预时机 | 推理前(并行多路径) | 推理中(途中回溯) | 推理前 + 训练时 |
| 主要代价 | 4× 推理 token | 1× 推理 + 监控算力 | 检索库构建一次性成本 |
| 适用模型 | 强模型(有能力产生异质解) | 量化小模型(易退化) | 任意规模 |
| 核心新增 | 架构异质性 | 过程统计监控 | 经验外部化 |
| 统计严谨度 | 中(多个 SOTA benchmark) | 低(作者自承非 confirmatory) | 中(可迁移验证) |
1. 异质化的胜利是结构性的,不是采样数量。PoTRE 用类似或更少 token 超越同质基线,说明 Self-Consistency 的天花板来自「同质性」而非「采样数」。这给推理增强研究一个明确信号:接下来比的不是 N 多大,而是路径多不同。
2. 过程监控是「弱模型推理增强」被低估的方向。MGT-B 诚实地把所有不显著的结果都标了出来——这种自我约束值得肯定。即便统计不硬,但方向是对的:量化小模型推理浪费严重,加个轻量监控就能捡回一部分准确率,比再训一遍便宜太多。
3. 经验检索是「RAG for reasoning」的觉醒。以前 RAG 检索的是事实,Experiential Abstractions 检索的是「解题模式」。两者本质同构——把不能直接进参数的知识外部化,按需加载。RL with abstraction-augmented prompts 是更狠的做法:训练时就让模型习惯「先看经验再下笔」。
4. 报告统计严谨度比单点结果更重要。三篇论文里 MGT-B 最有价值的地方不是 +2.5pp,而是它详细披露了哪些分析不是 confirmatory、empirical factor 是否合法 e-process 没建立。社区应该奖励这种诚实,而不是只奖励刷榜。
5. 实用建议。如果在做 reasoning 产品:①优先看 PoTRE 类异质架构而非堆 N;②如果只能用小模型,加 MGT-B 类监控而非重训;③数据集稳定后立刻做 abstraction 蒸馏,边际成本低且迁移性好。