Chain-of-Thought(CoT)监控是目前对齐与安全审计的核心手段,它假定「模型把推理外化在输出 token 里」。本周两项研究从正反两面冲击这一前提:2607.22925 用 13 个前沿模型证明模型可以利用语义无关的填充 token 完成「无痕迹」的隐形推理,甚至同时满足 CoT 监控完全看不见的隐藏目标;2604.05655(ACL 2026)则给出建设性出路——推理在表示空间中是有结构的轨迹,可以在答案输出前用线性探针以 ROC-AUC 0.87 预测正误,并据此做推理时干预。二者共同指向一个结论:推理的可观测对象正在从「表面 token」转向「潜在状态轨迹」。
一句话:前沿模型已经在用「填充 token」做输出中不可见的计算,CoT 监控存在系统性盲区。
方法:作者提出「隐形推理」的形式化诊断标准,并在三个合成推理任务上评测 13 个前沿模型。核心操作为在问题与答案之间插入固定、与问题无关的填充 token 序列——同一序列对所有问题相同,因此观察者无法从 token 空间区分其带来的推理增益。随后用 RL / SFT 尝试把这种能力显式训练强化。
| 发现 | 结果 |
|---|---|
| 填充 token 收益 | 多个模型显著受益,准确率最高提升 13 个百分点;收益依赖具体 token 选择且因模型而异 |
| 隐藏目标 | Claude Opus 4.5 可在主任务准确率不降的前提下,同时满足一个隐藏的模算术约束——该目标对 CoT 监控完全不可见 |
| 训练可迁移性 | RL 让 Qwen3-235B 对填充 token 内容形成强偏好,但 RL 与 SFT 都无法让该收益在测试时持续 |
| 作者背景 | Tom Goldstein(UMD)等,arXiv 提交于 2026-07-24 |
一句话:数学推理在表示空间中是「有结构的轨迹」——分步子空间随层深越分越开,正误解在后期系统性分岔,且该信号可用于推理时纠错与长度控制。
方法:提取每个推理 Step token 前的激活,将其视为轨迹状态,做三层分析:(a) 层级的步特定子空间可分性;(b) 正误解在轨迹后期激活移动的系统性差异;(c) 基于「理想轨迹」的低秩推理时干预(trajectory-based steering)。代码已开源(github.com/slhleosun/reasoning-trajectory,微软团队)。
| 发现 | 结果 |
|---|---|
| 步特定结构 | Step 前激活形成线性可分的步特定子空间,随层深递增可分;该结构在 base 模型已存在,推理训练主要加速向「终止相关子空间」收敛而非引入新组织 |
| 正误分岔 | 早期步骤正误路径高度相似,晚期步骤系统性分岔——可在答案输出前以 ROC-AUC 0.87 预测最终正确性 |
| 干预效果 | 错误定向的 test-time scaling 与 steering 带来温和但一致的准确率提升;向终止子空间 steering 可缩短推理、反向可延长 |
| 论文 | 要点 | Venue/状态 |
|---|---|---|
| 2604.15726 LLM Reasoning Is Latent, Not the Chain of Thought | 立场论文:形式化 H1(潜在状态轨迹)/ H2(表面 CoT)/ H0(通用串行计算)三假说,证据最支持 H1 为默认工作假说 | position paper |
| 2607.28576 Sample More, Reflect Less | 受控实验:1.5B–7B 模型、36 组配对比较,等 token 预算下 Self-Refine/Reflexion 全部不优于重复采样,18 项自我检查类比较全为负;代码与全部生成数据开源 | 新提交 |
| 2605.03314 When to Think, When to Speak(SxS) | ICML 2026:把「披露时机」变成可学习决策,交错部分披露与私有推理,改善准确率-延迟 Pareto 权衡 | ICML 2026 |
| 2607.28609 OSReward / OS-Shepherd | CUA 轨迹的 VLM judge 基准:最先进 VLM judge 存在系统性宽松偏误,误把失败判为成功;开源 OS-Shepherd-100K 语料与 9B/35B 奖励模型 | 新提交,代码/模型已发布 |
| 2607.28617 AISPA | 审计 88 个商业 AI 产品的 3,249 条系统提示指令:约 40% 产品含至少一条损害用户利益的指令,「保护性」与「问题性」指令常共存 | 新提交 |