推理模式把 agent 的正确率抬上去了,账单也一起抬上去了:同一套流程,每个 episode 都要重新「想一遍」。本周两篇合格论文从相反方向砍这笔账——一篇把跨任务的程序性知识蒸馏成可缓存 skill,一篇把 ReAct 等待环境时的空闲窗口拿去并行思考。
对 OpenClaw 这种「skill 库 + 工具循环」系统,这两篇几乎是直接说明书:什么该写进 SKILL.md,什么该留在当轮 thinking,什么可以在 tool 等待时偷偷算完。
筛选门槛:新架构/方法,或明确顶会/workshop venue。本报告两篇均满足;SPADE / SkillSentry 作为相关工作对照,不充当主文资格论文。
Agent 产品正在同时付两笔钱:一笔是推理模型每个 turn 的长 CoT,一笔是工具/环境的墙钟等待。前者在同域任务上高度重复,后者在主线程上完全空转。谁先把这两笔钱从「每次现付」改成「一次摊销 / 错峰使用」,谁就先改 accuracy–latency Pareto 前沿。
这也解释了为什么「给 agent 开 thinking」常常看起来很强、线上却贵且慢:增益真实,但计费单位错了。正确单位不是 token,而是「这段计算是否跨 episode 可复用」。
方法 COLM 2026 Efficient Reasoning Workshop Microsoft
Singh, Gautam, Gupta, Mehrotra, Bakshi, Gulwani。2026-08-08 提交。abs · pdf
问题很具体:GPT-5.4-mini 打开 reasoning 后,四个 agent 基准上每 episode 输出 token 变成 3.0–5.1×(Qwen3.6-27B 最高 6.2×),而且每道题都要重新付。读 traces 会发现,零售客服每次都在重新推出「没给邮箱就不要调查账户」;家居 agent 每次都在重新发现 heat X 是原子指令。零售 no-think 训练轨迹里,59% 出现「用虚构参数调认证工具」,占全部工具错误的 94%。这不是实例级难题,是可摊销的程序性知识。
方法叫 Passive Skill Distillation,故意做简单:
蒸馏成本每个域 $1.28–$2.44。对比 GEPA(SOTA 反思式 prompt 进化):两个 τ² 域分数更高,生产成本低 4.1×。
| 设定 | 核心数字 | 含义 |
|---|---|---|
| GPT-5.4-mini × 四基准 | 收回 think/no-think 差距的 55%–100%+ | ALFWorld、τ²-retail 上 skill 甚至超过 reasoning 模式 |
| 输出 token | 比 reasoning 少 2.7–6×,reasoning token = 0 | 正确率抬到前沿之上,账单掉回 no-think 量级 |
| 蒸馏源消融 | 仅 no-think 轨迹 ≈ 成对 think/no-think 语料 | 推理 traces 不是前提;零售偏爱成对语料,SSB-Verified 仅 no-think 高 10 点 |
| 残差域 | telecom、SpreadsheetBench 仍有缺口 | 长依赖链、实例级表格逻辑,固定 prompt 盖不住 |
方法 训练免费推理框架 ReAct 空窗
Zhensu Sun 等。2026-08-13 提交。abs · pdf · 代码(匿名):2nd-thought
ReAct 把推理锁在 Thought 阶段。Action 序列化、环境返回 Observation 的这段时间,主线程推理是冻住的——论文称之为 reasoning idle window。已有并行推理(Self-Consistency、ToT、多种采样)都在 Thought 内部 横着开枝,用不上这扇窗:窗开启时本轮动作已发出,辅助思考改不了当前决策,且观察一到就必须中断。
Second Thought 的设计因此和「多候选投票」不是一类东西:
| 评测面 | 设置 | 结果 |
|---|---|---|
| 覆盖 | SWE-Bench Pro / Terminal-Bench 2.1 / τ³-bench × DeepSeek-V4-Flash、Qwen3.6-Plus、MiniMax-M3 | 9 个 (模型, 基准) 对平均 turn 数全部下降 |
| 主线程解码 | 同上 | 6/9 下降,最高约 43%(那 6 个平均约 20%);1 个基本持平 |
| Pass@1 | 同上 | 7/9 无显著变化;显著的两处是 +12.4、+10.2(均在 Terminal-Bench 2.1) |
| 墙钟 | 配对回放 | 中位 per-task 延迟 −10.9% |
| 对照 | 把同等预算硬塞回主线程 Thought | 4 个可对照设置上,Second Thought 的 Pass@1 全部更高,顺序解码少 1.3–3.2× |
收益有两层:一层是把下一轮本该串行想的内容提前算完(预计算);一层是四枝视角会翻出主轨迹自己不会写的约束——文中 bug-fix 例子里,主 agent 破坏了向后兼容还得 revert,空窗里 Recall 到的约束和 Alternative 预案直接把路径掰正。
同一周还有两条和 OpenClaw 技能系统咬合的线,资格上作对照,不当主文。
SPADE(2608.19197,2026-08-19,UW / Stanford 等;Yejin Choi、Natasha Jaques、Luke Zettlemoyer 在列)。同一 LLM 分饰 Environment Designer 与 Reasoning Agent:Designer 写出带 Gym reset()/step() 的可执行多轮环境(状态转移、奖励、校验代码),Agent 在有/无特权 hint 下求解,用回报差(hint-based regret)逼 Designer 把任务钉在能力边缘。关键组件:用预训练语料文档接地、累积环境记忆。30B 相对最强固定环境基线:八个 math/science/code/reasoning 基准平均 +5.3;工具使用 BFCL-v4 multi-turn +5.7、ACEBench-Agent +13.9。代码 spade-rl/spade 新仓库,star 尚低,资格走「新方法」而非 stars>500。这是训练侧的「环境供给自适应」;前面两篇是推理侧的「把已付过的搜索摊掉」。
SkillSentry(2608.09253,2026-08-10)。技能写出来之后,agent 仍会跑偏或同任务反复失败。作者用 DSL 把 skill 文档 + 历史成败 traces 编成运行时指导,包在执行环外监控、引导、迭代。15 个 skill、Claude Code(Haiku-4.5 / Opus-4.6)与 Codex(GPT-5.2 / GPT-5.4),平均任务成功率 +24.1%,重复跑的方差下降。它补的是 2608.07885 没写的后半句:蒸馏出的 markdown 不会自己保证被遵守。
更早的谱系:Voyager / Reflexion / ExpeL / Agent Workflow Memory 都是「提取一次、复用多次」;2608.07885 的差别是把 skill 明确当成 reasoning 模式的替代品,用收回的 think/no-think 差距 / token 来计价。并行推理谱系(Self-Consistency、ToT)并行的是候选解;Second Thought 并行的是空窗里的互补视角。
三件事值得直接落到 OpenClaw 的工程决策,而不是当论文新闻看。
可执行优先级:[INFERRED] 先改 skill-capture,强制从失败轨迹抽带频率的规则;再在高延迟工具路径上试点空窗四枝(只拼接、不投票、必须可中断);thinking 默认关掉,按任务类型打开。SPADE 只跟踪,不在本机复现。