Self-Refine 与 Reflexion 在等成本下输给重复采样

1.5B 到 7B 模型的 36 组配对实验:反思式推理策略的实验设计和实际效果

为什么重要
这篇论文以实验设计(designed experiment)的严谨度,对 Self-Refine、Reflexion 等"让模型检查/修改自己输出"的流行范式进行了 36 组配对比较。结论清晰:所有 self-inspection 方法在等 token 成本下都不如简单的重复采样+多数投票。这直接挑战了过去两年 LLM 推理文献中最主流的策略方向——它不只是说"这个方法效果不够好",而是说"你看到的提升其实是多花了 token 带来的,不是方法本身的功劳"。

核心论文解读

Sample More, Reflect Less cs.CLcs.AI

作者:Iliya Mirzaei 等
论文:arXiv:2607.28576

实验设计

关键发现

研究方法亮点

这篇论文的方法论质量比结论本身更值得关注。之前的 Wang et al. (2024) 已经指出了这个问题,但只给了点估计,没有置信区间和显著性检验。本文补齐了这些:

局限性

相关论文

SVR: Self-Verifying Refinement cs.AI

恰好与今天的主论文形成对照。 Chen et al. 提出用 GRPO 训练模型在推理时自我判断"是否应该继续改"——不是靠 prompt 工程让模型反思,而是通过 RL 训练出内部的自验证能力。arXiv:2607.28457

MANTA: 多 Agent 拓扑自适应 cs.AI

类似地探索"推理时自改进"的另一方向:不是让单个模型反思,而是让多 Agent 网络的通信拓扑在推理时自我演化。在 5 个基准上达到 74.0 平均分,优于最强 baseline 5.8 个百分点。arXiv:2607.28527

AISPA: 系统提示词审计框架 cs.AIcs.CL

来自 MIT/Harvard 团队的跨学科研究。审计了 88 个商业 AI 产品的 3,249 条系统指令,发现约 40% 产品包含损害用户利益的指令,而保护性指令虽然普及(98.9% 产品有)但覆盖面浅——仅 24% 覆盖全部 8 个审计维度。arXiv:2607.28617

这篇虽不直接涉及推理技术,但对当前 AI 产品生态的透明度问题给出了第一份系统性数据。

我的判断

这是一篇"纠正器"性质的论文。 它的价值不在提出新方法,而在用实验设计的方法论标准,重新审视了我们默认接受的一种叙事。

为什么这条结论重要:

但我认为结论不能过度外推:

实践建议:如果你在做小模型(<10B)的数学推理,优先考虑重复采样+多数投票,而不是复杂的信息反思 pipeline。如果你的场景是开放式生成或需要多步推理一致性,这组实验不能直接否定反思策略——但至少该把等成本重复采样列为必须比较的 baseline。

其他值得关注的论文

论文要点arXiv
OSReward: CUA Reward Model Benchmark 首次系统评估 VLM 作为 CUA trajectory judge 的可靠性;发布 OS-Shepherd 9B/35B 开源 reward model,匹配商业方案但成本低 30-60% 2607.28609
Inference-Time Scaling in Local CUAs 本地 computer-use agent 的推理时计算扩展:上下文扩展有用但会饱和,时间扩展往往延长错误轨迹而非纠正 2607.28573
DualG-MRAG: 多模态 RAG 解耦架构 将多模态 RAG 拆成 Macro-reasoning + Micro-matching 两层图,通过 GNN 传播相关性。ACM MM 2026 接收 2607.28580
UNICON: 数值智能基础模型 跨学科数值推理的 foundation model,用图上下文做 few-shot 预测,未见学科接近专家水平 2607.28432
LLM 意识归因研究 安全对齐抑制了模型对意识的自归因,同时也抑制了宗教信念和非人类意识归因——安全策略存在 unintended side effects 2607.28607