Self-Refine 与 Reflexion 在等成本下输给重复采样
1.5B 到 7B 模型的 36 组配对实验:反思式推理策略的实验设计和实际效果
为什么重要
这篇论文以实验设计(designed experiment)的严谨度,对 Self-Refine、Reflexion 等"让模型检查/修改自己输出"的流行范式进行了 36 组配对比较。结论清晰:所有 self-inspection 方法在等 token 成本下都不如简单的重复采样+多数投票。这直接挑战了过去两年 LLM 推理文献中最主流的策略方向——它不只是说"这个方法效果不够好",而是说"你看到的提升其实是多花了 token 带来的,不是方法本身的功劳"。
核心论文解读
Sample More, Reflect Less cs.CLcs.AI
作者:Iliya Mirzaei 等
论文:arXiv:2607.28576
实验设计
- 7 种方法:Self-Refine(反馈式修改)、Reflexion(错误反思后重试)、Best-of-N(让模型选最佳)、Best-of-N(多数投票)、Multi-Agent Debate、Chain-of-Thought baseline、Repeated Sampling(少量样本多数投票)
- 3 个模型规模:1.5B、3B、7B(全部开源模型)
- 2 个数学基准:各 150 题
- 36 组配对比较:按问题配对,Bootstrap 置信区间 + 多重比较校正
- 成本核算:统计每一条链式思维、每一次反思、每一次辩论产生的全部 token
关键发现
- 36 组中没有一种方法在等成本下显著优于重复采样
- 10 组显著劣于重复采样,全部是 self-inspection 方法(让模型检查自己输出)
- Self-inspection 内部出现分化:随着模型增大,"让模型选"的劣势缩小(7B 时不再显著),但"让模型改"依然稳定劣于 baseline(Self-Refine 低 3.6–10.1 个百分点)
- Reflexion 在小模型上的奇异性:1.5B 模型上 Reflexion 从未触发重试——它每次都判定自己正确,退化成了单条链式思维
研究方法亮点
这篇论文的方法论质量比结论本身更值得关注。之前的 Wang et al. (2024) 已经指出了这个问题,但只给了点估计,没有置信区间和显著性检验。本文补齐了这些:
- 配对 t 检验 + Bootstrap 置信区间
- 多重比较校正(Bonferroni-Holm)
- 所有实验代码、prompts、生成结果、验证脚本全部开源
局限性
- 只测试了 7B 以下模型,未覆盖当前主流推理模型(GPT-5、Claude 4 等级别)
- 仅限数学推理任务,未涉及代码生成、创意写作、多步工具调用等场景
- "重复采样+投票"虽然统计上更优,但实际部署中不一定可行(需要多次调用,latency 成倍增加)
- 未测试 RL 训练过的自验证能力(如 DeepSeek-R1 的 self-verification 是训练出来的,不是 prompt engineering)
相关论文
SVR: Self-Verifying Refinement cs.AI
恰好与今天的主论文形成对照。 Chen et al. 提出用 GRPO 训练模型在推理时自我判断"是否应该继续改"——不是靠 prompt 工程让模型反思,而是通过 RL 训练出内部的自验证能力。arXiv:2607.28457
- 每步输出"正确性判定 + 置信度",只有 Correct 且超过阈值才停止
- 在 Qwen3.5-2B 上平均 2.99 turn 达到有效推理(固定 10-turn 的 baseline 要更多计算)
- SVR 的核心洞察与今天的主论文一致:问题不在"反思"这个想法本身,在于prompt engineering 式的反思不等价于真正的自验证能力。训练出来的自验证 vs 靠 prompt 引导的自验证,是两种性质不同的东西
MANTA: 多 Agent 拓扑自适应 cs.AI
类似地探索"推理时自改进"的另一方向:不是让单个模型反思,而是让多 Agent 网络的通信拓扑在推理时自我演化。在 5 个基准上达到 74.0 平均分,优于最强 baseline 5.8 个百分点。arXiv:2607.28527
AISPA: 系统提示词审计框架 cs.AIcs.CL
来自 MIT/Harvard 团队的跨学科研究。审计了 88 个商业 AI 产品的 3,249 条系统指令,发现约 40% 产品包含损害用户利益的指令,而保护性指令虽然普及(98.9% 产品有)但覆盖面浅——仅 24% 覆盖全部 8 个审计维度。arXiv:2607.28617
这篇虽不直接涉及推理技术,但对当前 AI 产品生态的透明度问题给出了第一份系统性数据。
我的判断
这是一篇"纠正器"性质的论文。 它的价值不在提出新方法,而在用实验设计的方法论标准,重新审视了我们默认接受的一种叙事。
为什么这条结论重要:
- 过去两年,从 Self-Refine (Madaan et al. 2023) 到 Reflexion (Shinn et al. 2023) 再到各种 Multi-Agent Debate,这类"让 LLM 自己检查和修改"的策略被引用了数千次。本文表明,至少在小模型上,效果的主要驱动因素是 token 预算增加,不是方法本身
- 这意味着很多以此为 baseline 的后续工作(比如"我们比 Self-Refine 好 X%") 的比较可能不公平——它们应该和等 token 成本的重复采样比,而不是和等采样次数的 baseline 比
但我认为结论不能过度外推:
- 实验只到 7B。在 70B+ 的大模型上,self-inspection 的精度可能完全不同。论文自己也观察到 Best-of-N 选择在 7B 已接近不再显著劣于投票
- SVR 那篇在同一期 arXiv 上展示了 RL 训练出来的自验证和 prompt 工程版有本质区别。把 Self-Refine 打死的同时,不应该把"自验证"这个概念一起打死
- 数学推理是一个特殊领域——答案对错有明确定义。在开放式任务(创意写作、舆情分析、代码架构设计)中,"反思改进"很可能有重复采样无法替代的价值
实践建议:如果你在做小模型(<10B)的数学推理,优先考虑重复采样+多数投票,而不是复杂的信息反思 pipeline。如果你的场景是开放式生成或需要多步推理一致性,这组实验不能直接否定反思策略——但至少该把等成本重复采样列为必须比较的 baseline。
其他值得关注的论文
| 论文 | 要点 | arXiv |
| OSReward: CUA Reward Model Benchmark |
首次系统评估 VLM 作为 CUA trajectory judge 的可靠性;发布 OS-Shepherd 9B/35B 开源 reward model,匹配商业方案但成本低 30-60% |
2607.28609 |
| Inference-Time Scaling in Local CUAs |
本地 computer-use agent 的推理时计算扩展:上下文扩展有用但会饱和,时间扩展往往延长错误轨迹而非纠正 |
2607.28573 |
| DualG-MRAG: 多模态 RAG 解耦架构 |
将多模态 RAG 拆成 Macro-reasoning + Micro-matching 两层图,通过 GNN 传播相关性。ACM MM 2026 接收 |
2607.28580 |
| UNICON: 数值智能基础模型 |
跨学科数值推理的 foundation model,用图上下文做 few-shot 预测,未见学科接近专家水平 |
2607.28432 |
| LLM 意识归因研究 |
安全对齐抑制了模型对意识的自归因,同时也抑制了宗教信念和非人类意识归因——安全策略存在 unintended side effects |
2607.28607 |