当学生卡壳时让老师接棒:小模型训练三大新范式

2026-07-29 · 聚焦 on-policy 蒸馏、token-level credit、互补记忆

为什么重要:今天(2026-07-28)ArXiv 三篇论文从三个不同角度回答了同一个底层问题——teacher 何时介入、介入多深、什么时候该让学生自己扛。对一个 0.6B–4B 规模的小模型而言,这不是效率优化题,而是它能不能学会推理的关键。这三篇彼此独立、放在一起却构成了完整的"学生训练"设计图。

核心论文 1:Relay-OPD(轨迹接力蒸馏)

arXiv:2607.26057 有代码 数学推理

Pass the Baton: Trajectory-Relayed On-Policy Distillation · Haolei Xu et al.(ZJU-REAL) · 2026-07-28

问题:On-Policy Distillation(OPD)的"prefix failure"——学生一旦在推理早期走错方向,后续所有 token 都在错的基础上累积,老师的监督信号也跟着失真。论文把这个观察叫 teacher-student continuation asymmetry:失败前缀上,老师倾向"转方向",学生倾向"硬坚持"。

方法:Relay-OPD 在检测到这种不对称点(label-free trigger)时,让老师短暂接管生成一段 teacher leg,然后学生从这段中途结果继续往下做,被优化的是整条接力 trajectory。Relay budget 设上限,确保不偏离 student policy 太远。

结果:Qwen3-4B-Instruct → Qwen3-1.7B/0.6B,八个数学推理基准:1.7B 比标准 OPD 提升 +5.73%,比 FastOPD 提升 +1.49%;训练轨迹长度缩短 50%+。

关键技术点

局限性

核心论文 2:CoRT(反事实 token-level credit)

arXiv:2607.25659 RL 细节 无需辅助模型

Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization · Bowen Zhang · 2026-07-28

GRPO 类 RL 管线有个公认缺陷:rubric 评判明明是 structured 的(多维度),最终却被压成一个 scalar 奖励,再广播到整个 response 上所有 token。一个 response 里"格式对了所以得 +1"和"逻辑错了所以得 −1"被加到一起除以总长,每 token 都拿到相同的 advantage。

CoRT 的解法:对同一个采样 response,用原 prompt(有 rubric 上下文)和去 rubric 上下文 prompt 各跑一遍,取 tokenwise log-likelihood contrast。这个 contrast 就是"这个 token 有多依赖 rubric 上下文"的代理——把 contrast 映射成 bounded、response-normalized 权重,重新分配 GRPO advantage。

方法是否需要辅助 scorer是否需要 learned reward model平均增益
Response-level GRPO基线
Learned token-level credit+~4.5 pp
CoRT(counterfactual)+4.4 pp

关键技术点

局限性

核心论文 3:UniMem(互补 episodic-parametric memory)

arXiv:2607.26017 长程任务 agent 视角

Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams · Siyu Xia et al.(PKU/ICT) · 2026-07-28

LLM agent 长期部署遇到 stability-plasticity dilemma:

UniMem 借鉴人脑(海马-皮层互补),引入 routing tokens 做 memory 控制器,路由新任务到 episodic buffer、老模式到可扩展的 parametric block,全程不用 task labels。

结果:长程 streaming task 序列上,三个 backbone 平均 +4.0 EM。Parametric memory 按需扩张,没有"无界增长"问题。

关键技术点

局限性

相关工作

我的判断

三篇合在一起,是同一问题的三视图

它们的共同观察是:外部帮助(teacher、rubric、past experience)的"接入时机"和"接入强度"比"接入与否"更重要。硬塞 teacher 监督等于用大模型的分布盖掉小模型——这是 RLHF/DPO 长期被诟病的 "mode collapse to teacher"。

对 picturebook-kg 的可借鉴度

结论:本周的"小模型训练"研究主旋律是精细化外部帮助。简单加蒸馏、加 RL、加 memory 都到尽头了,下一阶段的关键变量是时机和强度。这是值得写进 MEMORY.md 的趋势信号——任何"给本地小模型配大模型 / 外部知识"的方案,都该先问一句:什么时候帮?帮多深?