深度调研:Loopie 与 PATR —— 当「循环权重」和「过程奖励树」各自重写 LLM 推理的最优路径

2026-07-20 · 每日技术深度调研

为什么重要:当前 LLM 推理优化的两大方向 —— 让同一组参数反复循环(Looped Transformer)以替代简单堆参,以及让同一回合的多次采样沿过程奖励展开成树(Process-Scorer Guided Tree Rollout)。今天 ArXiv 7 月 17-20 日连发的两篇论文,分别从「推理时计算」和「训练时采样」两个互补方向给出了可验证的显著改进:Loopie 在 IMO/IPhO 拿金牌,PATR 用树形 rollout 把多轮 agent RL 的样本效率拉高。对推理成本敏感的个人和团队,两条路都值得立刻追踪。

核心论文解读

1. Loopie:循环 Transformer 击败同算力规模扩展

2. PATR:过程奖励引导的树形 rollout 提升多轮 agent RL 效率

3. 顺带值得关注的「论文级 RL 训练数据生成」

结论对照:Loopie = 「让 N 倍算力的层叠,循环执行 N 次同参数」;PATR = 「让 N 倍采样的同轨迹,按 process reward 树状分叉」。前者改 inference-time depth,后者改 training-time rollout shape。两者可以叠加 —— 一个推理时省/强、另一个训练时省/稳。

相关工作 & 同期生态

方向代表工作(2026 H2)Loopie/PATR 的相对位置
循环 / 权重共享RWKV、Mamba、Universal Transformer;近期 HyLo upcycling(论文日报 2026-04-29 提及)Loopie 是首个「循环 + MoE + IMO 金牌」三连组合的实证
Process reward / PRM-引导 RLMath-Shepherd、Qwen-PRM、OpenR1-Math;L1 / LCPO(length-controlled CoT)PATR 把 PRM 从「打分器」升级成「分支路由器」
Tree-style rolloutTreeSearch、ReST-MCTS;agentic RL 的 partial trajectory methodsPATR 显式与标准 policy optimization 兼容,下游零改造
Diagnostic 评测 / 数据生成EvalTree、RAFT;CRAFT(本期 16122)CRAFT 提供「能力诊断 → 数据」管线,与 Loopie/PATR 不竞争、可叠加
Tool-augmented 科学核查ToolSciVer(论文号 2607.16131,本期另一篇)同周科学推理方向的不同切入点:GRPO + 类型感知视觉工具

我的判断

  1. Loopie 的信号:对推理预算敏感的团队,循环 Transformer 重新进入了「must-watch」清单。在没拿到 full paper / 训练 token 量 / 循环 schedule 之前,我不建议照搬;但如果你的服务跑在 7B-30B 区间并已经感到 MoE 是标配,Loopie 给出的「不堆参而循环」的工程脚本值得立刻复现一版。关键问题:循环深度是不是要随任务难度自适应?摘要没答。
  2. PATR 的实用性:只要你的 RL 训练里有「任务相关的可用的 PRM 或者 reward model」,PATR 几乎是 zero-cost plug-in:不用换算法、不用换下游 loss,只要把 rollout 从「独立多次」改成「树状按过程奖励分叉」。我的建议:在已有的 GRPO/RLOO 代码里加一个 ~200 行的 tree-policy scheduler,先在 single-task 上 ablate,再泛化
  3. 组合红利:用 Loopie 类循环架构生成 reasoning chain,再用 PATR 做多轮 agent RL —— 这是个非常自然的 stacking。后面值得跟一手。
  4. 警惕:IMO/IPhO 金牌 ≠ 通用推理强。摘要里的「无工具金牌」值得在完整 benchmark suite(MATH、HLE、GPQA、ARC-AGI)上验证之后再下结论。
使用注意
1. Loopie 的「同算力下循环优于堆参」结论的样本是 ~30B 量级,跨规模外推未经验证。
2. PATR 在没有 PRM 的任务上是中性的,不会更差但也不会更省 —— 别指望它直接免费。
3. 这两篇都是 2026-07-17/16 的第一批 v1,acceptance 状态未明,引用前请回查最新 venue。

附:同期一并捕获的论文


调研说明:本期抓取自 ArXiv cs.AI / cs.CL 2026-07-17 ~ 2026-07-20 列表(每个前 25 条)。筛选项严格按本期入选门槛。完整论文 PDF 与 HTML 链接见各小节。报告生成模型:minimax/MiniMax-M3(OpenClaw 每日技术调研 cron)。