RLVR 之后的推理对齐:从 Tandem RL 到 LLM→World Model 的连续谱
2026-06-30 · 论文深度解读 · 来源:arXiv cs.AI / cs.CL(6/26–6/29 提交)
为什么重要:RLVR 已经成为 LLM reasoning 的事实标准训练范式,但它的副作用(idiosyncratic reasoning、readability 下降、language mixing)正在被行业感知。本期挑了两篇互相呼应的论文:Tandem RL 在 RLVR 内部尝试让 senior 推理风格主动适配 junior/human,而 From Tokens to States 从更上游给出框架——LLM 是不是 World Model 的一个特例,NTP→JEPA 之间存在连续谱。两个视角拼起来,能解释 RLVR 为什么会"长出怪癖",以及怎么修。
核心论文解读
① Tandem Reinforcement Learning with Verifiable Rewards(arXiv:2606.28166)
RLVRQwen3-4BGRPOhuman-compat
- 作者机构:Difan Jiao 等(具体机构未在摘要明示,6/26 v1 提交,21 页 / 7 图 / 8 表)。
- 关键问题:RLVR 训练出的 senior 模型推理能力很强(数学竞赛超人类),但风格漂移到 readability 差、language mixing 的 idiosyncratic pattern,junior 模型 / 人类难以跟上。
- 方法:把"tandem training"范式搬进 RLVR。Senior + 一个冻结的 junior 在同一条 rollout 上 stochastic 交替 co-generate,整条 rollout 共享 verifiable reward,GRPO loss 只对 senior 求。Senior 被迫生成 junior 能 follow 的推理路径。
- 实验:用 Qwen3-4B-Instruct 在 competition math 上训练。结果三条性质从同一种 rollout 结构里同时涌现出来:
- handoff robustness:交接给 junior 时更稳;
- distributional drift:相对 junior 分布偏移更小;
- legibility:CoT 对 junior 更可读。
- 关键数字:TRL 在 solo reasoning 上匹配 vanilla GRPO(不掉点)的前提下还拿到上述三个属性。
核心 insight:TRL 的"无成本拿到"是关键——它证明 RLVR 风格漂移不是可验证奖励本身的必然产物,而是缺乏"听众约束"。只要 reward signal 包含 junior 能否 follow 这条隐式约束,senior 就会被推向可读性,同时不牺牲 accuracy。
局限性:
- 实验仅在 competition math + Qwen3-4B 一个 scale 上验证,跨任务(code、tool use、开放域 QA)的迁移性未知;
- junior 是 frozen 的,没有探索"junior 自身也训练"的互动可能性;
- "legibility" 用什么 metric 度量、是否被 reward hacking 风险,论文未给充分消融;
- vanilla GRPO 已经是"对 junior 不友好"的吗?基线对比中 junior 到底是什么,定义不清晰。
② From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond(arXiv:2606.28127)
理论框架World ModelNTPJEPA
- 作者:Paul Dubois(6/26 v1,10 页 / 6 图 / 1 表)。
- 核心论点:LeCun 2022 提出的"LLM vs World Model"二分法是不必要的对立。作者给出两个主张:
- LLM 是 World Model 的退化特例:state space = 所有 token 序列,唯一 action = append 一个 token。World Model 是 LLM 的严格泛化,不是替代。
- 从 NTP 到 JEPA 存在自然连续谱,中间站包括 multi-token prediction、future-summary prediction、next-latent prediction——这些方向当下研究里都有人在做。
- 关键洞见:沿谱系往 JEPA 方向走,每一步都在逐步放弃让 LLM 可大规模训练的两个关键优势:
- internet-scale self-supervised 文本数据;
- 为离散 token 预测联合设计的 transformer 架构。
- 开放问题:作者把它框成两个研究问题——"数据悬崖"(self-supervised text → 仪器化的、动作标注的环境)和"架构问题"(transformer 能否泛化到连续状态预测,还是需要新原语)。
和 TRL 的呼应:TRL 的 senior-junior 互动可以看成 NTP→World Model 谱系里一个非常具体的中间形态——senior 不是模拟完整世界动力学,而是在一个"另一个模型的 hidden state"为约束的部分可观测环境里做 planning。这比"RLHF"或"self-play"更接近 world model 的精神。
局限性:
- 是立场论文 / 概念框架,没有新实验;
- "连续谱"是定义层面的优雅论证,缺少可操作的 metric 区分各档位;
- 对"放弃互联网数据"代价的评估偏乐观,没有量化 self-supervised 文本数据在 RLVR 时代的边际价值;
- JEPA 这端的具体实现路径模糊(Meta 的 V-JEPA 已存在但 vs 论文的连续谱定义边界不清)。
相关工作
| 方向 | 代表 | 与本期的关系 |
| RLVR 风格漂移 |
DeepSeek-R1、OpenAI o1/o3 系列报告 |
TRL 直接针对的就是 R1 风格 CoT 的人机不兼容问题 |
| Multi-token / future-token prediction |
Meta 的 multi-token prediction、GPT 系列 speculative decoding |
连续谱上 NTP→MTP 这一档 |
| JEPA / latent prediction |
Meta V-JEPA、LeCun 团队 2024–2025 工作 |
连续谱最远端 |
| Tandem training 起源 |
早期 mixture-of-experts / student-teacher distillation 流派 |
TRL 把这一思想搬进 RLVR 而非 SFT |
| Autoformalization 评估方法学 |
arXiv:2606.28013 Signal-Coverage Matrix |
同期 arXiv,同一天趋势:方法学反思(TC% 标量遮蔽了什么) |
| VLM 感知-知识冲突机理 |
arXiv:2606.28273 Vision-Default, Prior-Override |
同期 arXiv,从 mechanistic interpretability 角度解释 VLM 内部电路 |
我的判断
为什么这两篇要放在一起:TRL 是当下(2026 H1)RLVR 阵营遇到风格漂移问题后,最有说服力的治标方案——不换 reward function,不换 base model,只改 rollout 结构。From Tokens to States 是更上游的治本视角——如果 LLM 本身是 world model 的退化特例,那"RLVR 风格漂移"其实就是 senior 在缺乏环境反馈的状态空间里找捷径的必然结果,需要用 partial world model(junior 作为部分可观测环境)来约束。两者读完后,下一个值得跟的问题是:当 junior 本身也参与训练、且 senior 不知道 junior 状态时,Tandem RL 还能 match vanilla GRPO 吗?
别忽略的局限:TRL 论文只跑了一个 scale(4B)+ 一个 domain(competition math)。"匹配 vanilla GRPO"在 Qwen3-4B 上的意义和 70B / 推理密集型任务上完全不同。连续谱论文是 framing paper,没有实验。引用时要分别打标——前者是 empirical result(待复现),后者是概念贡献。
可执行 follow-up
- 复现优先级:中。TRL 的方法本身不难实现(改 rollout 即可),但 reward shaping 和 junior 选择是关键,论文给了细节但缺 ablation table。
- 产业相关性:高。RLVR 之后的下一步工程问题就是"如何让强模型不污染和它协作的弱模型 / 人类",TRL 是首个明确把这个目标写进 RL objective 的工作。
- 对 JC 当前项目的价值:低直接相关。picturebook-kg 用 LLM 做知识图谱抽取,本质是 SFT 而非 RLVR;但"用 junior 模型做 sanity check"的工作流,可以借鉴 Tandem RL 的"两个模型互相校验"思路——主模型抽取 + 轻量模型做 type/schema 约束。