学习信号不该均匀撒在整条轨迹上

2026-10-06 · 论文提交日 2026-10-02 · 列表为 arXiv cs.AI / cs.CL recent(10-05,show=25)

为什么重要

同一天的两篇预印本,从棋谱解释和终端智能体两端做同一件事:拒绝把整条轨迹当成一个学习单位。Queen 把一层搜索收成对根局面的解释,再蒸馏回模型;DepGPO 只把验证器真正读到的读写链上的命令当成该拿信用的步骤。共同前提是,轨迹级平均优势会把无关步骤和关键步骤绑在一起。

筛选只留新方法,不看热度。Queen(2610.03695)是编码器–解码器新架构加自然语言版 Bellman 更新;DepGPO(2610.03634)是依赖图上的信用再分配。两篇都还是预印本,下文不把它们写成已接收顶会。Queen 放出了代码;DepGPO 正文未给仓库,stars 未核。

核心论文解读

Queen:把沉默棋引擎接进语言模型

Adithya Bhaskar、Jeffrey Cheng、Danqi Chen。arXiv:2610.03695,代码 queen-project/queen。问题很具体:Lc0 一类 Transformer 棋引擎会下棋但不说人话;语言模型会写解释,但走子弱,解释就没有用。Queen 要同时给走子和解释。

架构是 Flamingo 式门控交叉注意力,但不用编码器最后一层包打。编码器是 Lc0 家族的 BT5(Leela):240M,15 层,隐藏维 1024,序列长度固定 64,一格一个 token,无搜索,接近超人类。解码器是通用指令模型 SmolLM3-3B:36 层,隐藏维 2048,几乎没有棋类训练。摘要写「4B」;正文实际是 3B 解码器加 240M 编码器。交叉注意力插在解码器第 2i 层之前,query 来自解码器,key/value 来自编码器第 i 层。领域适配时,已有参数冻结,只训这座桥。输入是 (FEN, 文本)。

课程分四段,按图 4:当前局面的静态特征,当前局面的着法与相互作用,由着法序列重建未来局面,再解释那个未来局面。消融说明这不是装饰。播种阶段之后,完整 Pawn-1 估计分 1782、战术首步无错率 73.9%;拿掉编码器或拿掉课程,估计分都掉到 514(32 局全负那一档),首步无错率分别是 9.7% 和 1.3%。

第二段才是这篇的方法核心,作者称为自然语言版 Bellman 更新,对照 AlphaZero 用搜索改进评估再蒸馏回网络。播种用 GPT-5.6-Sol(low)在 15,000 个 Lichess 局面上写解释(最佳着、主变、文字、三个候选着、局面评估),滤掉非法着和错着后 SFT,得到 Pawn-1。之后每轮:

  1. 从当前检查点对 Stockfish 的对局、人类对局、谜题里抽大约 40 万个根局面。
  2. 模型给出三个候选着。错着的定义是相对 Stockfish 期望胜率下降至少 10%。三个全错,就把最差的换成 Stockfish 着法。再分别解释这三个后继局面。
  3. 子节点若再预测出错着,丢掉当前根,从那个子节点接着递归,直到三个子解释的下一着都无错,或到达深度上限。
  4. 用 Qwen3.8-27B 把三个子解释收成根局面的解释,并指示它不要引入新内容。
  5. 若合并后的主变在第一处分歧上比原解释更差或非法,丢掉。剩下的从上一检查点做 SFT。

跑七轮,Pawn-8 改名 Queen。估计分路径是 1782 → 2024 → 2187 → 2346 → 2539 → 2434 → 2559 → 2697,净增 915。中间有一次回撤(2539 到 2434),不是单调爬坡。

模型锚定估计分备注
Leela BT5 编码器2987不解释
中位特级大师(Lichess blitz 锚)2730论文给出的参照,不是对局结果
Queen269732 局,对 8 个不同强度引擎
Gemini-3.1-Pro(high)2201同协议
GPT-5.6-Sol(high)2071同协议;Queen 的播种教师是 Sol 的 low
GPT-5.6-Luna(high)1822同协议
C1-4B514*32 局全负

论文把 2697 对 2071、2201 的差距换成期望胜率 97.4% 和 94.6%。这是由分差换算,不是 32 局里的直接胜率。分是用 Leela 网络的已知强度锚到 Lichess Elo,不是 FIDE 等级分。

解释质量被拆成三轴,不要混读。准确性看整局走子;substantiation 看预测主变里有没有错着;连贯性看文字。1000 个战术谜题上,Queen 的主变无错率 / 首步无错率是 68.8% / 91.6%,Gemini 66.9% / 82.5%,Sol 65.1% / 81.9%。1000 个一般局面上是 66.6% / 97.1%,对照 63.0% / 89.0% 和 61.5% / 86.8%。走子和主变是它真正赢的地方。

连贯性由 GPT-5.6-Sol(high)打 1–5 分。Queen 结构连贯 3.51、概念连贯 2.76、流畅 4.45;Sol 是 3.51 / 3.61 / 4.99;Gemini 是 3.55 / 3.30 / 4.98。结构分接近前沿模型,概念分明显更低。论文自己的解释是:反复蒸馏把分析树写进权重,所以结构分上去;套路名称和动机的幻觉会顺着合并步骤传播,概念分起不来。Queen 平均分析 30.0 ply,Sol 23.8 ply,更长也给了裁判更多扣分机会。

Queen 不是把 Leela 的策略头翻译成人话。在 1000 个「至少五步的期望胜率都落在 Stockfish 最优 3% 以内」的局面上,它有 53.8% 不选 Leela 的着(其中 39.1% 仍在 Leela 前五,14.7% 在前五之外)。但它离编码器仍有约 290 分(2697 对 2987)。作者把这叫做 verbalization debt:专家表征说出来,会损失强度。

还有一个容易漏掉的对照:不用前沿模型播种、改用 Stockfish 手工评估特征生成模板解释的 HCE 变体,前四轮估计分是 2115、2432、2476、2497,起点高于 Sol 播种的 1782、2024、2187、2346。论文据此说前沿教师不是必需。迭代搜索蒸馏才是强度曲线的来源,播种只是格式。

DepGPO:信用沿着读写依赖往回走

Yu Li 等。arXiv:2610.03634。终端任务里,后面的命令依赖前面写下的文件和打出来的路径、端口。GRPO / DAPO 的结果奖励是轨迹级的:一组采样比完之后,同一个优势加到这条轨迹的每一步。检视命令、被覆盖的写入、真正被验证器读到的写入,拿一样的梯度。

先看他们为什么认为现有步级方法不够。K=4 时,SFT 策略在 1376 个任务组里有 61% 组内奖励相同,组相对优势是 0。DAPO 可以丢掉这些组,但剩下的非零优势怎么分到命令,仍然没解决。GiGPO 靠相同环境状态分组;他们在终端里精确匹配,两个锚点最多的任务 25 个状态里只有 4 个重复。图方法(GEPO、GraphGPO、G2PO)用状态转移图的结构重要性,不追踪命令之间的信息流。终端轨迹其实有这个信息。

DepGPO 的图以命令为节点,边只有两类。文件边:后一个命令读到的、尚未被覆盖的行,连向最后一次写入这些行的命令。覆盖本身不产生边。标准输出边:后一个命令文本里复用了先前打印出的路径或端口,且该值不是任务描述里已经给过的。图无环。验证器读过的文件、端口、进程记为 E;验证器自己写下的文件不算。信用从 E 往回追。

写信用按行。命令 c 写下的被追踪行集合是 W_c,其中直接留在 E 里、或经后续写入间接到达 E 的子集是 W_c^E。间接贡献有两条保守限制:消费方必须写到另一个文件,并且不能覆盖正在计数的输入行。于是

q(c) = |W_c^E| / |W_c|    (有追踪行时)

没有文件行、但通过端口或进程到达 E 的写命令,信用为 1,否则为 0。一行最多计一次,不乘下游分数,写信用也不做距离衰减。

读命令 r 的信用是它能到达的写命令的衰减和:

q(r) = Σ_c  β^{d(r,c)} · Contrib(c)

d 是最短路径长度。主实验 β=0.5。读信用可以大于 1。写命令自己的读只用来连边,不另拿一份读信用;两类互斥。

同一交互步里的命令信用相加,得到 q_{i,t}。在有追踪命令的步上,减去本轨迹最低信用,再归一化,使这些步的因子均值为 1。最低信用的步因子是 0,即使原始信用为正。没有追踪命令的步因子先记为 1。若没有正信用的写到达 E,或步间信用没有差别,全部因子退回 1,也就是退回 GRPO。最后按进入损失的 token 数再归一化一次,使 token 加权平均优势仍等于原来的组相对优势。权重非负,所以优势的符号不变:失败轨迹上,高信用步骤被罚得更重,不是被奖励。

设定GRPO最强对照(表内)DepGPO
Qwen3.5-9B · SETA · TB2.011.09±0.26DPPO 15.36±0.9125.24±1.01
Qwen3.5-9B · SETA · TB2.111.01±0.67DPPO 15.81±0.4724.64±2.36
Qwen3.5-9B · TMAX · TB2.014.91±2.26DPPO 17.23±1.2820.45±0.98
Qwen3.5-9B · TMAX · TB2.117.83±0.57DPPO 18.95±2.3622.17±1.80
Qwen3.6-27B · SETA · TB2.025.09±1.11DPPO 28.24±1.5337.75±1.25
Qwen3.6-27B · SETA · TB2.123.37±0.67DAPO 28.16±1.1137.90±3.97
Qwen3.6-27B · TMAX · TB2.023.82±1.95DAPO 26.74±2.3435.06±1.35
Qwen3.6-27B · TMAX · TB2.124.94±0.45DPPO 26.67±1.9436.70±0.13

数字是 Terminal-Bench 2.0 / 2.1 的 pass@1(%),三次评估的均值±标准差。训练时每批 4 个任务、每任务 K=8,学习率 10−6,SETA 每条轨迹最多 10 步,TMAX 最多 56 步。评估允许 56 步,每题 5 次抽样。八个格子里 DepGPO 都是表内最高。论文给出的幅度:相对该格最强 RL 对照高 3.22 到 10.03 个点,相对 GRPO 高 4.34 到 14.53 个点。GiGPO 和 GraphGPO 在多个格子上低于 SFT,所以「换成任意步级信用」并不成立。

消融(9B,SETA)把「谁碰到了验证器」和「行级分数」拆开。只保留是否到达 E、去掉行级分数:TB2.0 / 2.1 为 23.07 / 22.55,比完整版低 2.17 / 2.09。不从 E 过滤、给所有写命令信用 1:18.65 / 17.75。TB2.0 低 6.59 个点(论文标注);TB2.1 从 24.64 到 17.75,差 6.89。过滤比分级更值钱。β 的敏感度也写了:0.5 最好,0.25、0.75 更差,β=1(读信用不衰减)更差。训练曲线上,GRPO 先升后降,GiGPO 更早掉下去;DepGPO 后期奖励更高,梯度范数没有掉到接近 0。步因子标准差随训练变大,选择越来越尖。

DepGPO 的信用是「执行记录里和 E 的相关性」,不是「这一步做对了」。高信用只决定信号放在哪,符号仍由组相对优势决定。另外,Terminal-Bench 2.0 的参考解答里,通向 E 的命令占比中位数是 0.57;不少于 5 条命令的 18 条轨迹里,中位数降到 0.18。长轨迹上,多数命令本来就不该拿满优势。

相关工作

和 Queen 同一天的 RC-OPD(2610.03515)处理的是纯文本推理,没有环境图。On-policy self-distillation 常用参考解答当后见之明,学生会借走正确结论,自己的错误留着。RC-OPD 对失败尝试定位最早的实质性错误,做局部修复,把修好的中间结果当作有效前缀的锚,再在固定修复预算里让学生从锚继续生成以检验修复。到达正确答案的链上,错误片段用失败诊断和修正目标监督,有效前缀用通向锚的推理监督。它和上面两篇的共同点是:监督对准结构(最早错误、有效前缀),而不是整段轨迹一个标签。本文没有复述它的实验表,数字以原文为准。

Queen 的架构亲戚是 Flamingo 的门控交叉注意力,以及 LLaVA 式前缀投影;附录里两种桥都做了消融,主文选的是分层交叉注意力而不是只投最后一层。棋类语言模型对照是 C1-4B(master distillation)和尚未放出模型的同期工作 LLAMIA,作者说架构相近但无法比。搜索蒸馏的谱系是 Bellman 价值迭代、AlphaZero 的 MCTS 蒸馏,以及 Schultz 等用 Transformer 拟合动作价值。Queen 把被蒸馏的对象从标量价值换成一段不引入新内容的合并解释。

DepGPO 明确对比的是 GRPO 的均匀优势、GiGPO 的同状态分组、HGPO 的历史上下文分组、GAGPO 的状态价值回传,以及 GEPO / GraphGPO / G2PO 的状态图。差别不在「用了图」,而在图的边是文件行和标准输出的真实读写,起点是验证器读集,不是模型自己估计的状态价值。HCAPO 用语言模型事后重评中间动作,DepGPO 不用另一个模型当裁判。

同列表里还有方法论文,这次不展开:Depth as Time(2610.03626,单步生成模型里去噪沿深度展开)、MRVQ(2610.03651,一个索引服务多种维度和码率)、NeutronGym(2610.03631,中子仪器设计的可执行环境)。它们合格,但不服务这条「轨迹不该被均匀监督」的线。

我的判断

两篇都值得读方法节,不值得读成「小模型已经超过前沿」或「终端 RL 的信用分配解决了」。判断如下。

  1. Queen 的硬结果是走子和主变,不是概念语言。概念连贯 2.76 对 Sol 的 3.61,是论文自己的表,不是外部挑刺。把它当成会讲棋的特级大师,会高估解释里的套路和动机。流畅分 4.45 只能说明句子通顺。
  2. 2697 来自 32 局、再锚到 Lichess。对 Sol、Gemini 的分差大,不太像噪声能解释的,但仍不是稳定的在线等级分,更不是 FIDE 分。C1-4B 全负被记成 514,这个地板会让「大幅超过先前棋类 LM」看起来比协议本身更宽。
  3. 强度不完全长在 3B 里。错着由 Stockfish 定义,合并由 Qwen3.8-27B 做,编码器是现成的 240M Leela。HCE 实验说明可以不靠前沿模型写种子解释,但oracle 和合并器还在环里。公平的说法是:一个小解码器,借专家表征和外部搜索痕迹,把分析树蒸馏进权重。
  4. DepGPO 更可迁移的部分不是终端这个域,而是「信用的分母必须来自任务实际检查的资源」。消融里,去掉验证器过滤比去掉行级分数伤得更重。没有可追踪读写的环境(纯对话、没有文件副作用的浏览器动作)套这套图,会经常掉进全 1 因子,也就是什么都没做。论文给了这个退路,使用时要记日志里有多少轨迹真的触发了再分配。
  5. 最低信用步的因子被置零,这比「按比例缩小」更狠。原始信用只是略低的检视命令,梯度会直接消失。若检视是后来写入的前提,读信用和 β 必须把它救回来;β=0.5 是他们扫出来的点,不是原理上的常数。
  6. 两篇都不覆盖没有沉默专家、也没有执行痕迹的开放域推理。RC-OPD 更靠近那一侧,但是修复学生自己的错误,不是环境图。下周如果只跟一条线,跟「监督对准结构」比跟「又一个棋类 Elo」有用。

一句话:Queen 证明沉默专家的隐藏状态可以经交叉注意力变成可蒸馏的解释,但概念层会在合并中漂移;DepGPO 证明终端里的结果奖励不该平均分,而该沿着验证器读集往回走。两者都把学习信号从「整段文本」改成「一段有结构的因果链」。