RLVR 之后的推理对齐:从 Tandem RL 到 LLM→World Model 的连续谱

2026-06-30 · 论文深度解读 · 来源:arXiv cs.AI / cs.CL(6/26–6/29 提交)

为什么重要:RLVR 已经成为 LLM reasoning 的事实标准训练范式,但它的副作用(idiosyncratic reasoning、readability 下降、language mixing)正在被行业感知。本期挑了两篇互相呼应的论文:Tandem RL 在 RLVR 内部尝试让 senior 推理风格主动适配 junior/human,而 From Tokens to States 从更上游给出框架——LLM 是不是 World Model 的一个特例,NTP→JEPA 之间存在连续谱。两个视角拼起来,能解释 RLVR 为什么会"长出怪癖",以及怎么修。

核心论文解读

① Tandem Reinforcement Learning with Verifiable Rewards(arXiv:2606.28166)

RLVRQwen3-4BGRPOhuman-compat

核心 insight:TRL 的"无成本拿到"是关键——它证明 RLVR 风格漂移不是可验证奖励本身的必然产物,而是缺乏"听众约束"。只要 reward signal 包含 junior 能否 follow 这条隐式约束,senior 就会被推向可读性,同时不牺牲 accuracy。

局限性:

② From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond(arXiv:2606.28127)

理论框架World ModelNTPJEPA

和 TRL 的呼应:TRL 的 senior-junior 互动可以看成 NTP→World Model 谱系里一个非常具体的中间形态——senior 不是模拟完整世界动力学,而是在一个"另一个模型的 hidden state"为约束的部分可观测环境里做 planning。这比"RLHF"或"self-play"更接近 world model 的精神。

局限性:

相关工作

方向代表与本期的关系
RLVR 风格漂移 DeepSeek-R1、OpenAI o1/o3 系列报告 TRL 直接针对的就是 R1 风格 CoT 的人机不兼容问题
Multi-token / future-token prediction Meta 的 multi-token prediction、GPT 系列 speculative decoding 连续谱上 NTP→MTP 这一档
JEPA / latent prediction Meta V-JEPA、LeCun 团队 2024–2025 工作 连续谱最远端
Tandem training 起源 早期 mixture-of-experts / student-teacher distillation 流派 TRL 把这一思想搬进 RLVR 而非 SFT
Autoformalization 评估方法学 arXiv:2606.28013 Signal-Coverage Matrix 同期 arXiv,同一天趋势:方法学反思(TC% 标量遮蔽了什么)
VLM 感知-知识冲突机理 arXiv:2606.28273 Vision-Default, Prior-Override 同期 arXiv,从 mechanistic interpretability 角度解释 VLM 内部电路

我的判断

为什么这两篇要放在一起:TRL 是当下(2026 H1)RLVR 阵营遇到风格漂移问题后,最有说服力的治标方案——不换 reward function,不换 base model,只改 rollout 结构。From Tokens to States 是更上游的治本视角——如果 LLM 本身是 world model 的退化特例,那"RLVR 风格漂移"其实就是 senior 在缺乏环境反馈的状态空间里找捷径的必然结果,需要用 partial world model(junior 作为部分可观测环境)来约束。两者读完后,下一个值得跟的问题是:当 junior 本身也参与训练、且 senior 不知道 junior 状态时,Tandem RL 还能 match vanilla GRPO 吗?
别忽略的局限:TRL 论文只跑了一个 scale(4B)+ 一个 domain(competition math)。"匹配 vanilla GRPO"在 Qwen3-4B 上的意义和 70B / 推理密集型任务上完全不同。连续谱论文是 framing paper,没有实验。引用时要分别打标——前者是 empirical result(待复现),后者是概念贡献

可执行 follow-up