为什么重要:2026 年 Q3 的 arXiv 同期出现了两篇直接对立的 Agent Skill 论文——一篇用 6000 次对照实验证明 skill 会让 agent 变差,另一篇用 self-play 框架声称 skill 能 push capability frontier。两篇论文都没错,但它们讨论的不是同一个"skill"。这意味着行业正在用同一个词指代三种不同的东西,而如何定义和评估 skill,正在成为 agent 工程化的关键岔路口。
arXiv:2607.22520cs.AI2026-07-24
作者:未注明团队(v1,2026-07-24 提交)
链接:arxiv.org/abs/2607.22520
核心方法:作者在两个 office automation benchmark、三个 harness stack 上跑了近 6000 次对照实验,对比"加 skill"和"不加 skill"的 agent 表现。关键不是平均成功率,而是把任务拆成两类——
关键发现:性能最好的 skill 不靠"做对更多"取胜,而靠"做错更少"。换句话说,skill 的竞争维度是回归率,不是覆盖率。
三大回归机制:
| 机制 | 触发条件 | 本质 |
|---|---|---|
| Skill description osmosis | skill 出现在 context 里但从未被调用 | 描述本身改变了 agent 行为 |
| Grounding displacement | skill 的 procedure 覆盖了对输入的解释方式 | 用预设步骤替换了 grounding |
| Verification displacement | procedure 抑制了输出检查 | "按步骤做"心理跳过了验证环节 |
局限性:
arXiv:2607.22529cs.CL2026-07-27
作者:Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang(13 人团队,疑似工业界背景)
链接:arxiv.org/abs/2607.22529
核心方法:Skill Self-Play (Skill-SP) 是一个三角色强化学习框架:
三个组件在同一个 RL loop 里 co-evolve——proposer 必须提出 solver 能验证的任务(避免假奖励),solver 必须在 skill 帮助下完成,controller 必须知道每个 skill 在什么场景下有效。
与论文①的关系:两篇作者都强调"skill 不是越多越好",但 Skill-SP 给出了 build-time 解法(通过 self-play 让 skill 自然收敛到有效集合),The Regression Tax 给出了 eval-time 解法(要求每个 skill 都通过回归测试)。这两篇应该一起读——它们是同一问题的两个面。
局限性:
arXiv:2607.22465cs.AIv22026-07-27
作者:Ritik Raj(v2 2026-07-27 更新,扩到 1196 KB)
链接:arxiv.org/abs/2607.22465
把 routing 决策从 per-call 提升到 per-task:进入时一次性分配一个 LLM backend,整个任务里所有调用都用它。Contextual bandit 训练,reward 用任务最终 accuracy + latency。
数据点:tau2-Bench 上比 latency-matched interpolation 高 7-8 accuracy points;Terminal-Bench 比最强单模型 baseline 高 7.1 accuracy points 同时省 36% 延迟。
为什么列入相关工作:当 agent 拥有多个 skill(每个 skill 可能绑定不同模型),TRACE-Router 的 task-level 路由解决了 skill 选择背后的成本-质量 tradeoff。Skill-SP 的 dynamic skill controller 在架构上和它同构。
arXiv:2607.22445cs.AI2026-07-24
企业 agent 当前是"静态超授权"——配置时一次性给所有 role 需要的 tool,攻击面巨大。作者提出 dynamic least-privilege:每次只给当前任务需要的最小权限。三源架构:role-based ceiling + task-context classifier + policy-derived combination prohibition。附带 600 条任务的合成数据集。
为什么相关:和 skill 问题是孪生兄弟——skill 决定了"agent 知道怎么做",capability scoping 决定了"agent 能拿到什么"。一个完整的 agent 安全框架必须同时管这两层。
读完这三篇,agent 工程化领域在 2026 年下半年进入了"评估学(evaluation science)"阶段,而不是"模型学(model science)"阶段。三个证据:
对自建 agent 项目的 actionable 启示: