本周两条独立论文指向同一个操作原则:体积不是覆盖。自训练里 IID 采样再按正确性过滤,会放大模型已经会的做法;长上下文里事先写死的稀疏或局部掩码,会错过随输入变化的依赖。该优化的是策略空间的覆盖,以及注意力交互几何的可学习衰减,而不是更多同类样本或更长的原文。
硬结果:Qwen3-4B 上、策略多样但错误的轨迹做自训练,胜过 235B 教师的 IID 蒸馏。在这篇论文的协议里,做法覆盖可以压过正确性和教师规模。
arXiv:2609.31571 · Gurung, Whitammer, Lapata · cs.CL · 2026-09-25
RL、test-time scaling、自训练都依赖重复采样,但只有响应在实质上不同时,多采样才有增益。标准自训练管线是 IID 采样,再主要按正确性过滤。这一步有两层塌缩:采样分布贴着模型已有模式;正确性过滤再把少数派做法扔掉,除非它们碰巧做对。训练集因此过代表模型已经会的策略。
论文把替代原则叫做 strategic diversity:对同一题的做法有实质差异,而不是表面 token 不同。实现有两条。GROOT 建一棵做法的层次树,再沿不同路径采样,用树结构强制覆盖,而不是指望 temperature 撞进另一个模式。Verbalized Sampling 是不建树的对照:让模型口头列出一组做法,再从这组做法里采样。域是竞赛编程和 Next-Chapter Prediction。策略采样训练出的模型,在难题上优于 IID 训练的对照,并且给 RL 和 test-time scaling 更好的初始化。
最值得记住的不是「错误更好」,而是信号在做法骨架里,不在终态标签里。学生没有的算法路径,即使这次走错,信息量仍可能高于教师在同一模式下的正确复述。
边界:竞赛编程里「算法选择」和「实现错误」相对可分,错误轨迹还可能留着有用骨架。若错误就在策略本身(选错工具、前提事实错),多样的错误会教错模式。论文没有证明错误轨迹普遍优于正确轨迹,只证明在这两个域、相对 IID 蒸馏,策略多样性可以压过正确性和教师规模。
arXiv:2609.31261 · Paolicelli 等 · cs.CL / cs.AI · 2026-09-25
稠密自注意力是二次的。常见高效替代事先决定哪里稀疏、哪里局部:滑窗、固定稀疏、ALiBi 式距离衰减。这些掩码是位置的函数,不是输入的函数。自然语言的依赖随输入变:有时远距必须保留(指代、约束、工具结果回指),有时近距足够。事先写死的几何会在两类样本上同时犯错。
MoSAR(Mixture of Semantic Attention Regimes)把近似看成几何问题。位置编码之后,输入条件的 query router 和 key router 在 short、medium、global 三种 regime 上做混合,诱导一个连续的、随距离衰减的注意力场,而不是一张固定稀疏掩码。几何在训练中学到;推理时可以用 top-1 routing 离散化,变成低成本近似。模型自己学哪里可以衰减、哪里必须保留远距交互。
对照是匹配的 500M 预训练。学到的几何 reach 明显更低,语言建模质量不降,训练上下文长度上困惑度优于稠密 RoPE。长度外推上,在所有受评变体里最好,包括 ALiBi。top-1 离散化后几何仍稳定,说明这不是只能在软混合下成立的花活。
证据停在 500M 的困惑度与长度外推,不是前沿规模的长上下文问答或智能体轨迹。reach 变低对「针在干草堆」可能有害——那些任务的正确几何恰恰是少数远距边。论文证明的是语言建模分布上可以学到更省、且可离散化的几何,没有证明所有下游任务都该换成 top-1。
同一周的列表里,另外四篇把「更多」拆到不同的空间上。它们各自命中筛选条件里的新方法、新数据集或官方技术报告,不靠未核验的 star 数入选。
| 论文 | 被浪费的「更多」 | 真正该覆盖的空间 | 关键数字 |
|---|---|---|---|
| 2609.31571 GROOT | IID 正确轨迹 | 做法树的不同路径 | 4B 错误多样轨迹 > 235B IID 蒸馏 |
| 2609.31261 MoSAR | 预先写死的稀疏/局部掩码 | 随输入变化的距离衰减 | 500M;外推 PPL 优于 ALiBi;top-1 仍稳定 |
| 2609.31563 多智能体缩放 | 同模型多数投票 | 任务结构 × 聚合机制 | 「至少一人对」+5–20pt,投票几乎吃不到 |
| 2609.31382 H2S | 把长文整段塞进推理 | 问题条件下的证据摘要 | 14B 平均 32.60,超 Qwen3.8-27B 10.17 |
| 2609.31430 LOHA / ACD | 把智能体自己的动作也压掉 | 只压缩旧工具观察 | K=3 上下文 −43% / −57% |
2609.31563(Fortuna, Bertalanic)用 Steiner 的群体任务分类看多智能体缩放。独立采样的智能体在题目条件下独立,大队伍极限因此可写死:多数投票收敛到模型的众数答案,平均收敛到该模型在该题上的偏差。13 个开源模型、队伍最大 30。析取任务上,「至少一人对」的概率随队伍增大 5–20 个点,但直接作答再投票几乎兑现不了这份潜力,和模型预测平均差在 0.5 点以内。多轮修订能明显抬准确率,但 1 个 peer 和 29 个 peer 的增益差不多。Fermi 估计看起来适合聚合,却几乎没有缩放收益:约 87% 的平方误差是模型共享的题目级偏差,平均只消掉约 6%。混模型族对 Fermi 有帮助,在析取任务上超不过最强单模型。
这是 GROOT 的聚合对偶。采样侧若塌在一个模式上,训练吃不到多样性;推理侧若用同模型投票,会把已经采到的多样性再折回众数。策略多样性必须被训练吃掉,或交给会使用不同轨迹的验证器,不能交给多数票。
2609.31382 Highlight-Then-Summarize 先标出有原文依据、且与问题相关的证据,再压成问题条件的摘要,然后才作答。训练集 6,647 条,来自 11 个基准族,平均上下文 43.9K。H2S-RL 除了终态对错,还给证据选择和摘要构造过程奖励。共享预算 128K 输入 / 4K 输出下,H2S-14B 七任务平均 32.60,比 Qwen3.8-27B 高 10.17,并且只保留 4K 输出预算时,还能保住 16K 预算成绩的 97.1%。代码在 X-Luffy/Highlight-Then-Summarize。
2609.31430 把同一原则用到软件工程智能体,口号是压缩你看到的,不要压缩你说出的。LOHA 把较旧的工具观察压成 soft token,保留智能体自己的回合和最近 K 条观察的原文。ACD 把基座模型在全文上的预测蒸馏进这个潜表示,同时用纯文本输入把行为锚回同一基座,避免软 token 适应把原行为带跑。SWE-bench Verified 上 K=3:Qwen3-4B 上下文每调用 −43%,SWE-Master-4B-RL −57%;解决率 12.1% / 21.8%,对照未压缩基座 14.5% / 27.5%。K=8 升到 14.4% / 23.0%,更大窗口用压缩换任务表现。32K 上限下,Qwen3 K=3 在 199 题子集上解决 21.1%,同一适应后的智能体用全文只有 11.1%,单卡并发吞吐约 1.9 倍。
H2S 和 LOHA 是内容轴:哪些 token 必须保持可引用。MoSAR 是几何轴:哪些 query-key 对允许交互。两轴正交,不要合成一条「压缩一切」的规则。
2609.31342 把一种时间对齐失败命名为 stale-document poisoning:过期证据让模型变错,尽管不检索时它答得对。基准是 317 条经日期官方来源核对的知识反转,覆盖医学、法律、软件和平台政策。不指示模型信任文档时,过期检索仍翻掉约 30% 的 Llama 答案和 37% 的 Qwen 答案;显式要求跟随文档则升到 66% 和 75%。四个开源模型、四个域上,投毒率 17–91%;匹配的最新证据被跟随的比例是 97–100%。只改评估日期、不改历史证据时,日期本身只带来有限适应;显式告诉模型旧证据何时失效,适应才清楚。对带记忆的智能体:没有检索优于错误检索。
2609.31473 是 Kaggle Game Arena 的官方技术报告:用国际象棋、扑克、狼人杀做持续升高难度的对战评测,覆盖完全信息、不完全信息和多人。本报告不引用其对局分数,摘要在抓取时被截断,避免转述未核对的名次。
2609.31360 复现了 program-of-layers:跳层优于标准前向,重复层优于跳层,两者合用最好;更难的题需要更多层重复。但他们没复现「学到的路由器单次推理」这一主结论:top-1 预测稳定塌回标准前向,尽管 top-k 程序合在一起确有准确率增益。纠错程序很脆,程序内部改掉一处编辑,纠正通常就失效。代码在 datexis.github.io/RE-PoLar。这和 MoSAR 的 top-1 稳定结论形成张力:可离散化是经验结果,不是学习路由的通性。
二级检索里同周还有 2609.26704(先采样概念/策略,再学搜索策略),与 GROOT 同族。其数字未核到一级摘要,此处不引用。
本周可执行的原则只有一句:覆盖对的空间,停止加同类体积。
若只改一处工程:采样端从「多采几条做对的」换成「沿做法树采不同路径」。投票、滑窗和全文塞进上下文,都是在用体积补偿覆盖失败,这周的论文说明这笔补偿基本是亏的。