为什么重要:2025-2026 年 reasoning 模型训练的核心矛盾是GRPO 的"长度膨胀"——准确率缓慢提升、但 trace 长度却成倍增加(Aggarwal & Welleck, 2025 已记录这一现象)。根因是 GRPO 只给最终答案打分,中间推理过程不可验证、无法获得奖励信号。Agon(arXiv 2607.07690)提出一个干净的解法:用第二个可比较的模型当隐式裁判,两模型在 draft-and-challenge 角色下相互竞争,谁推理得更好谁拿奖励。这把"好的推理"这个无法标注的问题转化成了可学习的对抗博弈。
核心结果:在 DeepMath 难题集上,Agon (Qwen3) 的 pass@1 约为 GRPO 的 2 倍、约 1.8× 未训练的 Mixture-of-Agents(MoA)pass(同等两轮推理预算)。在竞争性编程代码任务和 Qwen3.5 / Gemma 4 家族上排序一致复现。最小模型上的增益最大。
arXiv:2607.07690cs.LG / cs.CL · Vladislav Beliaev · 15 页 · arXiv 链接
核心思想:把"好的推理"这个不可标注的信号转化为对抗博弈中的胜负。两模型 A、B 在每个 step 互换角色(drafter / challenger),drafter 写解题过程,challenger 读对方草稿并独立解题;奖励 = 答对 + 比对手更强的 conversion bonus。竞争压力迫使每个模型推理得比"看过自己工作的对手"更聪明,过程自然被隐式打分。
关键设计:
推理部署:训练时怎么 deploy,推理时就怎么 deploy——A 草稿、B 读完 A 草稿作答的两阶段 cascade。无需额外训练专门的 verifier 或 aggregator。
局限性:
arXiv:2607.07646ICML 2026 Workshop on Compositional Learning · 8 页 · arXiv 链接
用完全可观测的 rewrite-grammar 环境研究 RL 后训练的本质。在可审计的符号重写系统里,论文证明 RL 不只是放大 base 模型已有的原始能力,还能把这些能力组合成更高层的策略。关键发现:
这是对 Agon 的机制层补充:Agon 给的是训练信号,这篇给的是能力构建机制。如果 Agon 的 cross-model 压力能迫使模型去发现可复用的组合程序,那它的作用机制就和本文一致——只是驱动信号从环境 reward 换成了对手胜负。
局限性:合成环境(rewrite grammar),不是自然语言推理。Workshop 论文(非 main conference),作者阵容未公开显示来自哪家 lab。
arXiv:2607.07695cs.AI / cs.GT / cs.MA · 33,924 games · arXiv 链接
同期一条独立的智体安全线。这篇不解决"如何训出更好推理",而是问:在多智体系统里,谁在决定安全——是模型本身还是部署规则(consequence rules)?
和 Agon 放在一起读有意思:Agon 让两模型在博弈中互训,这篇警告博弈规则本身就是安全的关键变量。当我们用 cross-model RL 训出更强的"对手"时,这些对手之间的 deployment 规则就是新的攻击面。
| 方向 | 代表工作 | 核心 | 与 Agon 关系 |
|---|---|---|---|
| Outcome-only RL | GRPO (Shao et al. 2024)、R1 (Guo et al. 2025) | 答案可验证,过程不评分 | Agon 替换的正是 GRPO 的奖励信号源 |
| 过程奖励模型 | Lightman et al. 2023 (Math-Shepherd PRM) | 训练 verifier 对 trace 每步打分 | 昂贵 + 不可验证;Agon 用对手替代 PRM |
| Self-play 推理 | Absolute Zero (Zhao 2025)、R-Zero (Huang 2025)、SPIN | 模型和自己的旧版本博弈 | Agon 升级为 cross-model,打破 self-play 的盲点闭锁 |
| Mixture-of-Agents | Wang et al. 2024 (MoA) | 多模型 cascade 推理,无训练 | Agon 训练过的 cascade 比 untrained MoA 高 ~1.8× |
| 长度控制 | Aggarwal & Welleck 2025 (length penalty / LCPO) | 直接压 trace 长度 | 治标,Agon 治本——改变的是信号本身 |
| Diffusion RLHF | arXiv 2607.07693 (per-timestep weighting) | diffusion 模型的 RLHF 反馈效率 | 同一日的同期工作,主题相邻 |
为什么 cross-model 比 self-play 强:Self-play 推理的盲点是"和过去的自己对弈"——你被锁在自己的失败模式里;一个行为差异化的同源模型虽然只强一点,但带来的梯度方向是新的。Agon 的 2×2 消融里那个"竞争无交换"的惰性 cell 就是这个论点的关键证据——光有竞争不够,必须在交换的基础上竞争。合作 + 交换(self-refinement cascade)能涨点,但涨不过竞争 + 交换。
不要把它当成 PRM 的替代品:Agon 解决的是"过程长度膨胀",不是"推理错误"。在 answer correctness 难以 verify 的开放任务上(对话 / 创意写作 / 商业建议),cross-model 博弈可能放大共同盲点而非消除它们。这是 cross-model RL 的开放问题——和 self-play 的失败模式同源,只是程度不同。
Agon 是一篇工程感很强的工作:问题真实(GRPO 长度膨胀是 2026 上半年 reasoning 训练最大痛点)、解法干净(不发明新算法,改信号源)、实现朴素(双 LoRA + stock GRPO)、消融 2×2 矩阵设计有说服力。它没有提出新的数学,提出的是一个信号工程上的新视角——把不可验证的"好推理"外包给一个行为差异化的对手。
短期落地:
待验证:
对独立开发者的实操建议:
放在一起看,7 月 9 日这批 arxiv 论文的共同主题是"推理质量的评估信号":Agon 从 cross-model 对抗拿信号,RL post-training 从 trace 可审计性拿信号,multi-agent safety 从规则变量拿信号。三篇都指向同一个认知:在 2026 年的 reasoning 训练里,"怎么判断对"比"怎么训大"更难。这是接下来一年最值得跟踪的研究问题。