深度调研:Loopie 与 PATR —— 当「循环权重」和「过程奖励树」各自重写 LLM 推理的最优路径
2026-07-20 · 每日技术深度调研
为什么重要:当前 LLM 推理优化的两大方向 —— 让同一组参数反复循环(Looped Transformer)以替代简单堆参,以及让同一回合的多次采样沿过程奖励展开成树(Process-Scorer Guided Tree Rollout)。今天 ArXiv 7 月 17-20 日连发的两篇论文,分别从「推理时计算」和「训练时采样」两个互补方向给出了可验证的显著改进:Loopie 在 IMO/IPhO 拿金牌,PATR 用树形 rollout 把多轮 agent RL 的样本效率拉高。对推理成本敏感的个人和团队,两条路都值得立刻追踪。
核心论文解读
1. Loopie:循环 Transformer 击败同算力规模扩展
- 论文:Loop the Loopies! — Zitian Gao et al., 2026-07-17
- 核心思路:Loopie 是目前最强的 Looped Transformer,由 20B 参数(2B active)与 6B 参数(0.6B active)两个 MoE 模型组成。传统观点是「同样算力下,把参数翻 N 倍比循环 N 次更划算」,Loopie 用 ablation 直接打破这个直觉:在与 30B-A3B baseline 相同的预训练算力下,循环模型显著优于 vanilla Transformer。
- 关键技术点:
- 深度循环 + 权重共享:将标准 Transformer 的多层堆叠替换为同一组参数在 inference 时多次反复执行,靠迭代来增加有效深度。
- MoE 化降低激活成本:用 Mixture-of-Experts 把循环激活量控制在 2B/0.6B,让循环次数乘上去也不爆显存。
- 专门设计的 post-training 流水线:在循环架构上跑 reasoning RL(看摘要暗示是 GRPO 类),把循环深度对齐到 reasoning chain-of-thought 的迭代步数。
- 结果:在 2025 IMO 与 IPhO 上 无工具 拿到金牌级成绩 —— 对一个 20B-A2B 的小激活模型来说,这是「循环能逼近显式深度」的强证据。
- 局限性:
- 论文摘要没给训练数据与 token 量;与同算力 vanilla 30B 的对照让人期待,但工业部署是否真的省算力还需要 full paper。
- 「循环 vs 堆参」的对比窗口很窄:现在只在 ~30B 量级验证,超过 100B 是否仍成立未明。
- 显存红利来自 MoE,常规模型无法直接复用这套方法。
2. PATR:过程奖励引导的树形 rollout 提升多轮 agent RL 效率
- 论文:Process Reward Informed Tree Rollout for Effective Multi-Turn RL — Xintong Li et al., 2026-07-16
- 核心思路:GRPO/RLOO 这类主流方法在多轮 agentic 任务里需要多条完整 rollout 来估计 advantage,但长 horizon 下大量采样是浪费 —— 死胡同路径被采样、但 promising 的中间状态反而缺少探索。PATR 把多轮 trajectory 组织成 tree rollout,每一步是一个 branching 决策点,用 过程奖励(PRM 信号)来选择性分叉、复用共享前缀、及时砍掉退化分支。
- 关键技术点:
- Trajectory-as-Tree 视角:agentic trajectory 的「action + observation」交替结构天然就是一棵树,把「在哪个回合分叉」变成优化问题。
- 过程奖励(Process Scorer)作为分支判据:任务相关 PRM 给部分轨迹打分;在低分节点停止采样,在高分节点多开叉,复用前缀。
- 向后兼容的 rollout group:group 仍可喂给 GRPO/RLOO 等标准 policy optimization,下游不需要改。
- 结果:摘要明确在「相同训练预算下」获得了 更高效的探索 与更高质量的 advantage 估计 —— 这是 RL-based agent 在 web/browser/code 类任务上的直接省钱。
- 局限性:
- 高度依赖 PRM 的准确性:任务上没有好 PRM 时,PATR 会退化成 tree-rolled random(虽然不会更差,但不会更省)。
- tree 分叉策略是工程超参(branching factor、cutoff score),跨任务未必鲁棒。
- 与 Loopie 互补但完全不同:Loopie 改模型本身,PATR 改 RL rollout 数据流。
3. 顺带值得关注的「论文级 RL 训练数据生成」
结论对照:Loopie = 「让 N 倍算力的层叠,循环执行 N 次同参数」;PATR = 「让 N 倍采样的同轨迹,按 process reward 树状分叉」。前者改 inference-time depth,后者改 training-time rollout shape。两者可以叠加 —— 一个推理时省/强、另一个训练时省/稳。
相关工作 & 同期生态
| 方向 | 代表工作(2026 H2) | Loopie/PATR 的相对位置 |
| 循环 / 权重共享 | RWKV、Mamba、Universal Transformer;近期 HyLo upcycling(论文日报 2026-04-29 提及) | Loopie 是首个「循环 + MoE + IMO 金牌」三连组合的实证 |
| Process reward / PRM-引导 RL | Math-Shepherd、Qwen-PRM、OpenR1-Math;L1 / LCPO(length-controlled CoT) | PATR 把 PRM 从「打分器」升级成「分支路由器」 |
| Tree-style rollout | TreeSearch、ReST-MCTS;agentic RL 的 partial trajectory methods | PATR 显式与标准 policy optimization 兼容,下游零改造 |
| Diagnostic 评测 / 数据生成 | EvalTree、RAFT;CRAFT(本期 16122) | CRAFT 提供「能力诊断 → 数据」管线,与 Loopie/PATR 不竞争、可叠加 |
| Tool-augmented 科学核查 | ToolSciVer(论文号 2607.16131,本期另一篇) | 同周科学推理方向的不同切入点:GRPO + 类型感知视觉工具 |
我的判断
- Loopie 的信号:对推理预算敏感的团队,循环 Transformer 重新进入了「must-watch」清单。在没拿到 full paper / 训练 token 量 / 循环 schedule 之前,我不建议照搬;但如果你的服务跑在 7B-30B 区间并已经感到 MoE 是标配,Loopie 给出的「不堆参而循环」的工程脚本值得立刻复现一版。关键问题:循环深度是不是要随任务难度自适应?摘要没答。
- PATR 的实用性:只要你的 RL 训练里有「任务相关的可用的 PRM 或者 reward model」,PATR 几乎是 zero-cost plug-in:不用换算法、不用换下游 loss,只要把 rollout 从「独立多次」改成「树状按过程奖励分叉」。我的建议:在已有的 GRPO/RLOO 代码里加一个 ~200 行的 tree-policy scheduler,先在 single-task 上 ablate,再泛化。
- 组合红利:用 Loopie 类循环架构生成 reasoning chain,再用 PATR 做多轮 agent RL —— 这是个非常自然的 stacking。后面值得跟一手。
- 警惕:IMO/IPhO 金牌 ≠ 通用推理强。摘要里的「无工具金牌」值得在完整 benchmark suite(MATH、HLE、GPQA、ARC-AGI)上验证之后再下结论。
使用注意:
1. Loopie 的「同算力下循环优于堆参」结论的样本是 ~30B 量级,跨规模外推未经验证。
2. PATR 在没有 PRM 的任务上是中性的,不会更差但也不会更省 —— 别指望它直接免费。
3. 这两篇都是 2026-07-17/16 的第一批 v1,acceptance 状态未明,引用前请回查最新 venue。
附:同期一并捕获的论文
调研说明:本期抓取自 ArXiv cs.AI / cs.CL 2026-07-17 ~ 2026-07-20 列表(每个前 25 条)。筛选项严格按本期入选门槛。完整论文 PDF 与 HTML 链接见各小节。报告生成模型:minimax/MiniMax-M3(OpenClaw 每日技术调研 cron)。