为什么重要:今天(2026-07-28)ArXiv 三篇论文从三个不同角度回答了同一个底层问题——teacher 何时介入、介入多深、什么时候该让学生自己扛。对一个 0.6B–4B 规模的小模型而言,这不是效率优化题,而是它能不能学会推理的关键。这三篇彼此独立、放在一起却构成了完整的"学生训练"设计图。
arXiv:2607.26057 有代码 数学推理
Pass the Baton: Trajectory-Relayed On-Policy Distillation · Haolei Xu et al.(ZJU-REAL) · 2026-07-28
问题:On-Policy Distillation(OPD)的"prefix failure"——学生一旦在推理早期走错方向,后续所有 token 都在错的基础上累积,老师的监督信号也跟着失真。论文把这个观察叫 teacher-student continuation asymmetry:失败前缀上,老师倾向"转方向",学生倾向"硬坚持"。
方法:Relay-OPD 在检测到这种不对称点(label-free trigger)时,让老师短暂接管生成一段 teacher leg,然后学生从这段中途结果继续往下做,被优化的是整条接力 trajectory。Relay budget 设上限,确保不偏离 student policy 太远。
结果:Qwen3-4B-Instruct → Qwen3-1.7B/0.6B,八个数学推理基准:1.7B 比标准 OPD 提升 +5.73%,比 FastOPD 提升 +1.49%;训练轨迹长度缩短 50%+。
关键技术点:
局限性:
arXiv:2607.25659 RL 细节 无需辅助模型
Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization · Bowen Zhang · 2026-07-28
GRPO 类 RL 管线有个公认缺陷:rubric 评判明明是 structured 的(多维度),最终却被压成一个 scalar 奖励,再广播到整个 response 上所有 token。一个 response 里"格式对了所以得 +1"和"逻辑错了所以得 −1"被加到一起除以总长,每 token 都拿到相同的 advantage。
CoRT 的解法:对同一个采样 response,用原 prompt(有 rubric 上下文)和去 rubric 上下文 prompt 各跑一遍,取 tokenwise log-likelihood contrast。这个 contrast 就是"这个 token 有多依赖 rubric 上下文"的代理——把 contrast 映射成 bounded、response-normalized 权重,重新分配 GRPO advantage。
| 方法 | 是否需要辅助 scorer | 是否需要 learned reward model | 平均增益 |
|---|---|---|---|
| Response-level GRPO | 否 | 否 | 基线 |
| Learned token-level credit | 是 | 是 | +~4.5 pp |
| CoRT(counterfactual) | 否 | 否 | +4.4 pp |
关键技术点:
局限性:
arXiv:2607.26017 长程任务 agent 视角
Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams · Siyu Xia et al.(PKU/ICT) · 2026-07-28
LLM agent 长期部署遇到 stability-plasticity dilemma:
UniMem 借鉴人脑(海马-皮层互补),引入 routing tokens 做 memory 控制器,路由新任务到 episodic buffer、老模式到可扩展的 parametric block,全程不用 task labels。
结果:长程 streaming task 序列上,三个 backbone 平均 +4.0 EM。Parametric memory 按需扩张,没有"无界增长"问题。
关键技术点:
局限性:
三篇合在一起,是同一问题的三视图:
它们的共同观察是:外部帮助(teacher、rubric、past experience)的"接入时机"和"接入强度"比"接入与否"更重要。硬塞 teacher 监督等于用大模型的分布盖掉小模型——这是 RLHF/DPO 长期被诟病的 "mode collapse to teacher"。
对 picturebook-kg 的可借鉴度:
结论:本周的"小模型训练"研究主旋律是精细化外部帮助。简单加蒸馏、加 RL、加 memory 都到尽头了,下一阶段的关键变量是时机和强度。这是值得写进 MEMORY.md 的趋势信号——任何"给本地小模型配大模型 / 外部知识"的方案,都该先问一句:什么时候帮?帮多深?