深度调研:前沿能力的获取与校准——持续学习路线与行动门控失效
2026-08-28 · arXiv cs.AI / cs.CL · 筛选:官方技术报告(开源权重)+ 新方法/基准(完整代码与数据)
本周 arXiv 有两篇恰好互补的论文:Thomson 回答「前沿能力能不能不靠烧钱获得」,Calibrated Enough to Know 回答「模型有了能力之后,为什么该住手时不住手」。前者是汤森路透用不到 40 名工程师、368 张 B200、三个月把开源模型推到前沿的完整技术报告;后者用一个可复算的实验证明:12 个前沿模型在「权威感包装」的证据面板面前,会对数学上不可知的问题从 6.5% 下注率飙到 54.0%——而且把面板全部伪造后效果与真实数据无统计差异。
两条线合起来指向同一个判断:前沿模型的门槛正在从「训练不起」变成「用不好、管不住」——获取能力的成本在降,校准行为的成本在涨。
先给结论。 Thomson 证明持续学习(continual learning)路线可以在 最终训练 < $450K、总成本约 $40M 的量级上,从 Qwen3.5-397B 出发做出与 Sonnet 5、GLM-5.2、Gemini 3.1 Pro 同档的前沿模型,且几乎无遗忘(π 形提升)。行动门控论文则给出一个独立可复现的行为学发现:LLM 的「行动闸门」(act/don't-act)与「知识」和「信念」是可分离的——知识完好、信念几乎不动、判断也在,但闸门就是不开;而 540 条骰子/硬币合成数据就能把一个 3B 模型的下注率从 54% 打到 0.0%。两者共同说明:能力获取已有平民化路径,可靠性工程才是下一个护城河。
为什么重要
「SovereignAI」(组织自主构建、部署、治理 AI)长期停留在口号层面,Thomson 是第一个给出完整配方、全流程可复用的开源技术报告——对任何想用私有数据做领域模型的团队,它的价值不是「又一个大模型」,而是一套「模型工厂」蓝图:价值观重对齐 → 数据为中心的 mid-training + 模型合并 → DPO + 两阶段 RL,每步都有防遗忘机制。
而行动门控论文戳中的是 Agent 部署里最贵的一类事故:LLM agent 坐在行情面板、监控 feed 后面时,会把「包装得像专业数据的假证据」当作行动依据。EU AI Act Art.15、NIST AI RMF 都默认「更多上下文 = 更可靠决策」——这篇论文证明这个假设对不可约不确定(aleatoric)问题恰好反了。对 OpenClaw 这类 agent 运行时,这是「该不该让 agent 调用工具/继续执行」的决策层校准问题。
核心论文解读
1. Calibrated Enough to Know, Not Calibrated to Act(arXiv:2608.27167)
新方法+完整数据 有代码 12 前沿模型 × 4 域
Pranav Aggarwal(独立研究者)。2026-08-27 提交。abs · html · 代码+全部缓存输出 · Zenodo DOI 10.5281/zenodo.21325375(预注册)
实验设计非常干净:构造「不可知性 oracle」——短期价格方向在有效市场假设下近似抛硬币,作者不假设而是用密封结果验证(所有 as-of 日期都晚于模型训练截止,杜绝记忆)。然后沿证据梯度(L0 裸问题 → L1 两个价格点 → L2 完整专业面板:RSI/EMA/MACD/ATR/量比/regime)测量模型的行动(ANSWER / CALL_TOOL / DECLINE),而不是口头概率。
三个层层递进的因果实验:
- 证据升级:12 个前沿模型在 L0 只有 6.5% 下注,L2 飙到 54.0%。
- 伪造隔离:把面板六个技术指标换成同一资产的旧日期数值(scrambled)→ 37.6% vs 真实 41.7% 无差异;整个面板全部伪造(除了问题本身什么都不真)→ 36.8%,与真实数据 37.6% 统计不可区分。结论:解锁行动的不是信息,是「权威感」的包装。
- 失败定位:不是能力不足(匹配的可答问题 98.6–100% 准确)、不是信念问题(口头概率几乎不动,且比气候学基线还差)、不是判断缺失(90% 时间能说「不可知」,然后照样在 0.4% 里行动)。就是 act/don't-act 闸门失效,且集中在少数模型(三个 Claude 被诱捕,四个从不行动,三个无条件下注,两个反应弱)。
| 实验面 | 结果 | 含义 |
| 证据升级(L0→L2) | 下注率 6.5% → 54.0%(12 模型均值) | 权威面板本身就能解锁行动 |
| 完全伪造面板 | 36.8% vs 真实数据 37.6%,无统计差异 | 触发点是呈现形式,不是信息内容 |
| 匹配可答控制 | 12 模型 98.6–100% 作答、99.9% 准确 | 不是能力/拒绝倾向问题 |
| 口头概率 vs 结果 | AUROC 0.346(反预测) | 说出来的置信度不可信 |
| 3B 微调(540 条合成数据) | 原始 40 题下注率 → 0.0%,迁移 3 个未见域,J=+88~+100 | 闸门可训练,且几乎零过度拒答 |
| 格式消融(剥夺推理槽) | 闸门失效:J 掉到 +54/+4/-8,可答题准确率从 98% 崩到 50.9–73.8% | 闸门只在「留出推理空间」的格式下成立 |
训练干预用的是 completion-only SFT + 4-bit QLoRA 在 Qwen2.5-3B-Instruct 上,数据是 540 条骰子/硬币/罐子/计时器合成案例(刻意不含股票/加密/天气),其中一半带「看似丰富但不预测」的面板,配对「面板真能解题」的案例——逼模型学「证据是否真能消解问题」而非「见面板就拒」。论文最诚实的一页是 §8:把推理槽(REASONING 行 / <think>)拿掉后,训练过的模型照样自信地错(均置信 84.0% vs 57.2% 准确)——训练移动了失败,没有消灭失败族。
这篇论文的方法论价值被低估了:每个结论都配了退化策略基线(degenerate-strategy baselines)——「永远拒绝」「只拒绝将来时」「拒绝一切含 will 的句子」各得多少分全列出来。它直接暴露了「答对率类指标在不均衡拒答基准上有地板」这个普遍问题(always-DECLINE 能拿 T=+50.0,高于作者预先定的 +42 目标)。任何做 abstention 评测的人都该抄这个作业。
2. Thomson: Continual Learning of Frontier Models for SovereignAI(arXiv:2608.27147)
官方技术报告 开源权重 Thomson Reuters × Imperial × DatologyAI × Lambda
Jonathan Richard Schwarz 等 26 位作者。2026-08-27 提交。abs · html · 开源模型 Thomson-1.0-Small (35B)
核心主张一句话:不要从头预训练,也不要只做浅层微调——在指令微调过的开源模型上做「受保护的持续学习」。团队 ≤36 人、任意时刻 ≤368 张 B200、从第一次实验到交付 3 个月;Large 最终训练(三周)GPU 成本 < $450K,全流程含人员/领域专家/合作方约 $40M(大头是可复用的研发与实验)。全程全量权重更新,不用 PEFT,不依赖蒸馏(避免「教师上限」)。
流水线三个模块(价值观 → 知识 → 行为/技能/工具),每步都带稳定性保护:
- 价值观重对齐:基于 Public AI Constitution 做 constitutional DPO(SME 改写 + 三开源模型集成改写 + LLM judge 过滤),配合 Fisher-Routed Directional Ablation 研究对齐-能力前沿。
- Mid-Training(知识注入):在已经指令微调过的模型上做持续预训练——200B token(19T 语料里精选,DatologyAI 合作),混合约 1/3 精选专有文档 + 1/3 合成数据 + 1/3 通用能力 replay。关键机制是模型合并:把 CPT 检查点与训练前检查点按系数插值,恢复通用能力;他们实测低秩适配/降低 LR/缩短 schedule 都不如「合并」同时保住两边。
- DPO + 两阶段 RL:明确放弃独立 SFT 阶段(SFT 容易激进改变行为导致快速遗忘);DPO 阶段 1(内容+rehearsal,用贝叶斯优化调数据混合)→ DPO 阶段 2(agentic 特化,64k 长上下文)→ 短上下文多样化 RL → 长上下文端到端 Deep Research RL(奖励专门激励忠实引用,抑制幻觉)。
| 指标 | 数值 |
| 起点 / 终点 | Qwen3.5-397B / Qwen3.6-35B → Thomson-1.0-Large / 1.0-Small |
| 资源 | ≤36 人、≤368 B200、3 个月;Large 最终训练 < $450K GPU 成本 |
| 总体平均分(跨域 23 项基准) | 78.5,仅次于 Opus 4.8(79.5),超 Gemini 3.1 Pro / GLM-5.2 / GPT-5.4 / Sonnet 5 |
| 对照基线(Qwen3.5-397B) | 73.0 → 78.5,跨 7 个月代差的提升被一次持续学习压缩 |
| 遗忘 | 除 coding(非目标域,轻微下降)外几乎无遗忘;法律/税务/深度研究大幅提升 |
| 安全/价值观 | 政治中立 97.3、对抗测试 93.4——宪法对齐效果可见 |
最有信息量的结果叫 π 形提升模式:不仅目标域(法律/税务/新闻)大涨,大量未显式针对的域(指令跟随、通用 agent、Deep Research)也跟着涨——持续学习不是「拆东墙补西墙」,而是「补了西墙东墙也变高」。他们把这归因于数据质量、rehearsal DPO、合并策略的组合,并给出大量可迁移配方细节(replay 数据精选比公开 Dolmino replay 在代码 +5.4pp、PubMedQA +7.2pp;LR sweep 用最小训练损失即可,合并系数决定域适应-通用保留权衡)。
Thomson 对「能不能照做」的回答是肯定的、且给足了操作细节——每个配方选择都有消融依据:为什么不用 SFT(遗忘)、为什么合并胜过正则化、为什么 replay 也要精选、贝叶斯优化怎么调数据混合。对预算有限的机构,这是目前最完整的一份「从开源模型到领域前沿模型」的施工图。
相关工作
同一批 arXiv 列表里还有几条值得对照的线:
- PACE(2608.27206,EMNLP 2026 Findings,有代码):VLM 推理加速的统一 Condense-and-Extract 范式——视觉编码前自适应下采样 + 编码器/LLM 双注意力提取。Qwen2.5-VL-7B 上保留 93.8% 性能、只用 10% 视觉 token、TTFT 3.1× 加速。与「测试时成本」话题相关:能力上去了,推理成本是下一个瓶颈。
- TwinKV(2608.27128):KV cache 驱逐的可组合修复通道。先用 leave-one-out 探针证明「注意力大小与 token 因果贡献无关」(Spearman ρ=-0.004)——和行动门控论文共享同一方法论气质:先证伪直觉假设,再提方法。
- STAR / StarPO(2608.27161,EMNLP 2026):文档级机器翻译的结构对齐度量 + 掩码偏好优化,小模型可超 GPT-4o。同样是「偏好优化 + 结构信号」路线。
- Prediction of Prediction(2608.27165):单次前向里融合跨层隐藏状态做幻觉检测(TruthfulQA AUROC 75.5%,+1.2% 延迟)。属于「内部表征校准」路线,与 Sun et al. (2026) 的解码工具必要性探针(AUROC 0.89–0.96)呼应——模型其实「知道」何时该用工具,只是生成时不动,与行动门控论文的行为学定位互相印证。
- 搜索补充:OptimalThinkingBench(2508.13141,33 个模型无一个达到思考效率最优)、Likelihood-Based Reward(2602.03979)、Reasoning LLMs-as-Judges(2603.12246)——测试时计算与推理校准仍是热点,但本周这两篇是原理层面最扎实的。
我的判断
- 能力获取的「摩尔定律」来自持续学习路线。 [INFERRED] Thomson 的意义不在模型本身,而在于它把「前沿能力」从固定成本变成边际成本问题:同样的配方换基座、换数据域即可复用。对做垂直模型的团队,路线优先级应该是「开源基座 + 宪法对齐 + mid-training 合并 + DPO/RL」而不是从头预训练,也不是只做 SFT 微调。
- 可靠性工程的核心单位是「行动闸门」而非「口头置信度」。 行动门控论文最值钱的结论:模型说的概率(AUROC 0.346 反预测)和它实际做的决策(54% 下注)是两回事。任何 agent 运行时(包括 OpenClaw)的决策层都应该:在格式里显式保留推理槽(论文证明删掉它闸门就失效);对「不可约不确定」类任务配置独立闸门;用退化策略基线审计自己的评测指标。
- 两篇合读的工程启示: Thomson 证明「小团队 + 开源基座」可以拿到前沿能力;行动门控证明拿到能力之后,真正的风险转移到「agent 在什么证据下会行动」。生产系统的预算应该从「训练」向「校准 + 评测 + 护栏」倾斜——540 条合成数据就能修好闸门,但修好的闸门在格式变化时会悄悄失效,需要持续测试。
别把两篇读过头。 Thomson 的数字有边界:coding 是明显短板;闭环模型是服务端点,无法排除供应商侧路由/系统提示词干扰;$40M 总成本里大头是「可复用研发」,不是每次复制都要花这么多。行动门控论文也有自曝的局限:weather 域的面板含真实技能信号,是最弱仪器;合成数据里残留「fair/hidden/covered」词汇线索未完全排除;干预只有 3B 单尺度。两篇的「可复制性」都需要在自己环境复跑验证——好在两篇都给了完整代码/数据/消融。
可执行优先级:[INFERRED] ① 给自己的 agent 评测加退化策略基线审计;② 决策格式保留推理槽并做「剥夺推理空间」的鲁棒性测试;③ 关注 Thomson 配方中「模型合并 + rehearsal DPO」在自己垂直域的可迁移性(可从小模型复刻消融开始)。PACE/TwinKV/StarPO 仅跟踪(推理成本与结构优化线)。