Agon: 用对手当评委——cross-model RL 如何破解 GRPO 的"长度膨胀"难题

2026-07-09 · 来源: arXiv cs.AI / cs.LG · 作者: Vladislav Beliaev

为什么重要:2025-2026 年 reasoning 模型训练的核心矛盾是GRPO 的"长度膨胀"——准确率缓慢提升、但 trace 长度却成倍增加(Aggarwal & Welleck, 2025 已记录这一现象)。根因是 GRPO 只给最终答案打分,中间推理过程不可验证、无法获得奖励信号。Agon(arXiv 2607.07690)提出一个干净的解法:用第二个可比较的模型当隐式裁判,两模型在 draft-and-challenge 角色下相互竞争,谁推理得更好谁拿奖励。这把"好的推理"这个无法标注的问题转化成了可学习的对抗博弈。

核心结果:在 DeepMath 难题集上,Agon (Qwen3) 的 pass@1 约为 GRPO 的 2 倍、约 1.8× 未训练的 Mixture-of-Agents(MoA)pass(同等两轮推理预算)。在竞争性编程代码任务和 Qwen3.5 / Gemma 4 家族上排序一致复现。最小模型上的增益最大。

核心论文解读

1. Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

arXiv:2607.07690cs.LG / cs.CL · Vladislav Beliaev · 15 页 · arXiv 链接

核心思想:把"好的推理"这个不可标注的信号转化为对抗博弈中的胜负。两模型 A、B 在每个 step 互换角色(drafter / challenger),drafter 写解题过程,challenger 读对方草稿并独立解题;奖励 = 答对 + 比对手更强的 conversion bonus。竞争压力迫使每个模型推理得比"看过自己工作的对手"更聪明,过程自然被隐式打分。

关键设计

推理部署:训练时怎么 deploy,推理时就怎么 deploy——A 草稿、B 读完 A 草稿作答的两阶段 cascade。无需额外训练专门的 verifier 或 aggregator。

局限性

2. RL Post-Training Builds Compositional Reasoning Strategies

arXiv:2607.07646ICML 2026 Workshop on Compositional Learning · 8 页 · arXiv 链接

用完全可观测的 rewrite-grammar 环境研究 RL 后训练的本质。在可审计的符号重写系统里,论文证明 RL 不只是放大 base 模型已有的原始能力,还能把这些能力组合成更高层的策略。关键发现:

这是对 Agon 的机制层补充:Agon 给的是训练信号,这篇给的是能力构建机制。如果 Agon 的 cross-model 压力能迫使模型去发现可复用的组合程序,那它的作用机制就和本文一致——只是驱动信号从环境 reward 换成了对手胜负。

局限性:合成环境(rewrite grammar),不是自然语言推理。Workshop 论文(非 main conference),作者阵容未公开显示来自哪家 lab。

3. Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety

arXiv:2607.07695cs.AI / cs.GT / cs.MA · 33,924 games · arXiv 链接

同期一条独立的智体安全线。这篇不解决"如何训出更好推理",而是问:在多智体系统里,谁在决定安全——是模型本身还是部署规则(consequence rules)?

和 Agon 放在一起读有意思:Agon 让两模型在博弈中互训,这篇警告博弈规则本身就是安全的关键变量。当我们用 cross-model RL 训出更强的"对手"时,这些对手之间的 deployment 规则就是新的攻击面。

相关工作

方向代表工作核心与 Agon 关系
Outcome-only RL GRPO (Shao et al. 2024)、R1 (Guo et al. 2025) 答案可验证,过程不评分 Agon 替换的正是 GRPO 的奖励信号源
过程奖励模型 Lightman et al. 2023 (Math-Shepherd PRM) 训练 verifier 对 trace 每步打分 昂贵 + 不可验证;Agon 用对手替代 PRM
Self-play 推理 Absolute Zero (Zhao 2025)、R-Zero (Huang 2025)、SPIN 模型和自己的旧版本博弈 Agon 升级为 cross-model,打破 self-play 的盲点闭锁
Mixture-of-Agents Wang et al. 2024 (MoA) 多模型 cascade 推理,无训练 Agon 训练过的 cascade 比 untrained MoA 高 ~1.8×
长度控制 Aggarwal & Welleck 2025 (length penalty / LCPO) 直接压 trace 长度 治标,Agon 治本——改变的是信号本身
Diffusion RLHF arXiv 2607.07693 (per-timestep weighting) diffusion 模型的 RLHF 反馈效率 同一日的同期工作,主题相邻

技术观察

为什么 cross-model 比 self-play 强:Self-play 推理的盲点是"和过去的自己对弈"——你被锁在自己的失败模式里;一个行为差异化的同源模型虽然只强一点,但带来的梯度方向是新的。Agon 的 2×2 消融里那个"竞争无交换"的惰性 cell 就是这个论点的关键证据——光有竞争不够,必须在交换的基础上竞争。合作 + 交换(self-refinement cascade)能涨点,但涨不过竞争 + 交换。

不要把它当成 PRM 的替代品:Agon 解决的是"过程长度膨胀",不是"推理错误"。在 answer correctness 难以 verify 的开放任务上(对话 / 创意写作 / 商业建议),cross-model 博弈可能放大共同盲点而非消除它们。这是 cross-model RL 的开放问题——和 self-play 的失败模式同源,只是程度不同。

我的判断

Agon 是一篇工程感很强的工作:问题真实(GRPO 长度膨胀是 2026 上半年 reasoning 训练最大痛点)、解法干净(不发明新算法,改信号源)、实现朴素(双 LoRA + stock GRPO)、消融 2×2 矩阵设计有说服力。它没有提出新的数学,提出的是一个信号工程上的新视角——把不可验证的"好推理"外包给一个行为差异化的对手。

短期落地:

待验证:

对独立开发者的实操建议:

放在一起看,7 月 9 日这批 arxiv 论文的共同主题是"推理质量的评估信号":Agon 从 cross-model 对抗拿信号,RL post-training 从 trace 可审计性拿信号,multi-agent safety 从规则变量拿信号。三篇都指向同一个认知:在 2026 年的 reasoning 训练里,"怎么判断对"比"怎么训大"更难。这是接下来一年最值得跟踪的研究问题。