深度调研:前沿能力的获取与校准——持续学习路线与行动门控失效

2026-08-28 · arXiv cs.AI / cs.CL · 筛选:官方技术报告(开源权重)+ 新方法/基准(完整代码与数据)

本周 arXiv 有两篇恰好互补的论文:Thomson 回答「前沿能力能不能不靠烧钱获得」,Calibrated Enough to Know 回答「模型有了能力之后,为什么该住手时不住手」。前者是汤森路透用不到 40 名工程师、368 张 B200、三个月把开源模型推到前沿的完整技术报告;后者用一个可复算的实验证明:12 个前沿模型在「权威感包装」的证据面板面前,会对数学上不可知的问题从 6.5% 下注率飙到 54.0%——而且把面板全部伪造后效果与真实数据无统计差异。

两条线合起来指向同一个判断:前沿模型的门槛正在从「训练不起」变成「用不好、管不住」——获取能力的成本在降,校准行为的成本在涨。

先给结论。 Thomson 证明持续学习(continual learning)路线可以在 最终训练 < $450K、总成本约 $40M 的量级上,从 Qwen3.5-397B 出发做出与 Sonnet 5、GLM-5.2、Gemini 3.1 Pro 同档的前沿模型,且几乎无遗忘(π 形提升)。行动门控论文则给出一个独立可复现的行为学发现:LLM 的「行动闸门」(act/don't-act)与「知识」和「信念」是可分离的——知识完好、信念几乎不动、判断也在,但闸门就是不开;而 540 条骰子/硬币合成数据就能把一个 3B 模型的下注率从 54% 打到 0.0%。两者共同说明:能力获取已有平民化路径,可靠性工程才是下一个护城河。

为什么重要

「SovereignAI」(组织自主构建、部署、治理 AI)长期停留在口号层面,Thomson 是第一个给出完整配方、全流程可复用的开源技术报告——对任何想用私有数据做领域模型的团队,它的价值不是「又一个大模型」,而是一套「模型工厂」蓝图:价值观重对齐 → 数据为中心的 mid-training + 模型合并 → DPO + 两阶段 RL,每步都有防遗忘机制。

而行动门控论文戳中的是 Agent 部署里最贵的一类事故:LLM agent 坐在行情面板、监控 feed 后面时,会把「包装得像专业数据的假证据」当作行动依据。EU AI Act Art.15、NIST AI RMF 都默认「更多上下文 = 更可靠决策」——这篇论文证明这个假设对不可约不确定(aleatoric)问题恰好反了。对 OpenClaw 这类 agent 运行时,这是「该不该让 agent 调用工具/继续执行」的决策层校准问题。

核心论文解读

1. Calibrated Enough to Know, Not Calibrated to Act(arXiv:2608.27167)

新方法+完整数据 有代码 12 前沿模型 × 4 域

Pranav Aggarwal(独立研究者)。2026-08-27 提交。abs · html · 代码+全部缓存输出 · Zenodo DOI 10.5281/zenodo.21325375(预注册)

实验设计非常干净:构造「不可知性 oracle」——短期价格方向在有效市场假设下近似抛硬币,作者不假设而是用密封结果验证(所有 as-of 日期都晚于模型训练截止,杜绝记忆)。然后沿证据梯度(L0 裸问题 → L1 两个价格点 → L2 完整专业面板:RSI/EMA/MACD/ATR/量比/regime)测量模型的行动(ANSWER / CALL_TOOL / DECLINE),而不是口头概率。

三个层层递进的因果实验:

实验面结果含义
证据升级(L0→L2)下注率 6.5% → 54.0%(12 模型均值)权威面板本身就能解锁行动
完全伪造面板36.8% vs 真实数据 37.6%,无统计差异触发点是呈现形式,不是信息内容
匹配可答控制12 模型 98.6–100% 作答、99.9% 准确不是能力/拒绝倾向问题
口头概率 vs 结果AUROC 0.346(反预测)说出来的置信度不可信
3B 微调(540 条合成数据)原始 40 题下注率 → 0.0%,迁移 3 个未见域,J=+88~+100闸门可训练,且几乎零过度拒答
格式消融(剥夺推理槽)闸门失效:J 掉到 +54/+4/-8,可答题准确率从 98% 崩到 50.9–73.8%闸门只在「留出推理空间」的格式下成立

训练干预用的是 completion-only SFT + 4-bit QLoRA 在 Qwen2.5-3B-Instruct 上,数据是 540 条骰子/硬币/罐子/计时器合成案例(刻意不含股票/加密/天气),其中一半带「看似丰富但不预测」的面板,配对「面板真能解题」的案例——逼模型学「证据是否真能消解问题」而非「见面板就拒」。论文最诚实的一页是 §8:把推理槽(REASONING 行 / <think>)拿掉后,训练过的模型照样自信地错(均置信 84.0% vs 57.2% 准确)——训练移动了失败,没有消灭失败族

这篇论文的方法论价值被低估了:每个结论都配了退化策略基线(degenerate-strategy baselines)——「永远拒绝」「只拒绝将来时」「拒绝一切含 will 的句子」各得多少分全列出来。它直接暴露了「答对率类指标在不均衡拒答基准上有地板」这个普遍问题(always-DECLINE 能拿 T=+50.0,高于作者预先定的 +42 目标)。任何做 abstention 评测的人都该抄这个作业。

2. Thomson: Continual Learning of Frontier Models for SovereignAI(arXiv:2608.27147)

官方技术报告 开源权重 Thomson Reuters × Imperial × DatologyAI × Lambda

Jonathan Richard Schwarz 等 26 位作者。2026-08-27 提交。abs · html · 开源模型 Thomson-1.0-Small (35B)

核心主张一句话:不要从头预训练,也不要只做浅层微调——在指令微调过的开源模型上做「受保护的持续学习」。团队 ≤36 人、任意时刻 ≤368 张 B200、从第一次实验到交付 3 个月;Large 最终训练(三周)GPU 成本 < $450K,全流程含人员/领域专家/合作方约 $40M(大头是可复用的研发与实验)。全程全量权重更新,不用 PEFT,不依赖蒸馏(避免「教师上限」)。

流水线三个模块(价值观 → 知识 → 行为/技能/工具),每步都带稳定性保护:

  1. 价值观重对齐:基于 Public AI Constitution 做 constitutional DPO(SME 改写 + 三开源模型集成改写 + LLM judge 过滤),配合 Fisher-Routed Directional Ablation 研究对齐-能力前沿。
  2. Mid-Training(知识注入):在已经指令微调过的模型上做持续预训练——200B token(19T 语料里精选,DatologyAI 合作),混合约 1/3 精选专有文档 + 1/3 合成数据 + 1/3 通用能力 replay。关键机制是模型合并:把 CPT 检查点与训练前检查点按系数插值,恢复通用能力;他们实测低秩适配/降低 LR/缩短 schedule 都不如「合并」同时保住两边。
  3. DPO + 两阶段 RL:明确放弃独立 SFT 阶段(SFT 容易激进改变行为导致快速遗忘);DPO 阶段 1(内容+rehearsal,用贝叶斯优化调数据混合)→ DPO 阶段 2(agentic 特化,64k 长上下文)→ 短上下文多样化 RL → 长上下文端到端 Deep Research RL(奖励专门激励忠实引用,抑制幻觉)。
指标数值
起点 / 终点Qwen3.5-397B / Qwen3.6-35B → Thomson-1.0-Large / 1.0-Small
资源≤36 人、≤368 B200、3 个月;Large 最终训练 < $450K GPU 成本
总体平均分(跨域 23 项基准)78.5,仅次于 Opus 4.8(79.5),超 Gemini 3.1 Pro / GLM-5.2 / GPT-5.4 / Sonnet 5
对照基线(Qwen3.5-397B)73.0 → 78.5,跨 7 个月代差的提升被一次持续学习压缩
遗忘除 coding(非目标域,轻微下降)外几乎无遗忘;法律/税务/深度研究大幅提升
安全/价值观政治中立 97.3、对抗测试 93.4——宪法对齐效果可见

最有信息量的结果叫 π 形提升模式:不仅目标域(法律/税务/新闻)大涨,大量未显式针对的域(指令跟随、通用 agent、Deep Research)也跟着涨——持续学习不是「拆东墙补西墙」,而是「补了西墙东墙也变高」。他们把这归因于数据质量、rehearsal DPO、合并策略的组合,并给出大量可迁移配方细节(replay 数据精选比公开 Dolmino replay 在代码 +5.4pp、PubMedQA +7.2pp;LR sweep 用最小训练损失即可,合并系数决定域适应-通用保留权衡)。

Thomson 对「能不能照做」的回答是肯定的、且给足了操作细节——每个配方选择都有消融依据:为什么不用 SFT(遗忘)、为什么合并胜过正则化、为什么 replay 也要精选、贝叶斯优化怎么调数据混合。对预算有限的机构,这是目前最完整的一份「从开源模型到领域前沿模型」的施工图。

相关工作

同一批 arXiv 列表里还有几条值得对照的线:

我的判断

  1. 能力获取的「摩尔定律」来自持续学习路线。 [INFERRED] Thomson 的意义不在模型本身,而在于它把「前沿能力」从固定成本变成边际成本问题:同样的配方换基座、换数据域即可复用。对做垂直模型的团队,路线优先级应该是「开源基座 + 宪法对齐 + mid-training 合并 + DPO/RL」而不是从头预训练,也不是只做 SFT 微调。
  2. 可靠性工程的核心单位是「行动闸门」而非「口头置信度」。 行动门控论文最值钱的结论:模型说的概率(AUROC 0.346 反预测)和它实际做的决策(54% 下注)是两回事。任何 agent 运行时(包括 OpenClaw)的决策层都应该:在格式里显式保留推理槽(论文证明删掉它闸门就失效);对「不可约不确定」类任务配置独立闸门;用退化策略基线审计自己的评测指标。
  3. 两篇合读的工程启示: Thomson 证明「小团队 + 开源基座」可以拿到前沿能力;行动门控证明拿到能力之后,真正的风险转移到「agent 在什么证据下会行动」。生产系统的预算应该从「训练」向「校准 + 评测 + 护栏」倾斜——540 条合成数据就能修好闸门,但修好的闸门在格式变化时会悄悄失效,需要持续测试。
别把两篇读过头。 Thomson 的数字有边界:coding 是明显短板;闭环模型是服务端点,无法排除供应商侧路由/系统提示词干扰;$40M 总成本里大头是「可复用研发」,不是每次复制都要花这么多。行动门控论文也有自曝的局限:weather 域的面板含真实技能信号,是最弱仪器;合成数据里残留「fair/hidden/covered」词汇线索未完全排除;干预只有 3B 单尺度。两篇的「可复制性」都需要在自己环境复跑验证——好在两篇都给了完整代码/数据/消融。

可执行优先级:[INFERRED] ① 给自己的 agent 评测加退化策略基线审计;② 决策格式保留推理槽并做「剥夺推理空间」的鲁棒性测试;③ 关注 Thomson 配方中「模型合并 + rehearsal DPO」在自己垂直域的可迁移性(可从小模型复刻消融开始)。PACE/TwinKV/StarPO 仅跟踪(推理成本与结构优化线)。