Agent 系统的瓶颈正在从「会不会调工具」转向「会不会把经验变成可复用状态」。本周两篇同日投稿的工作,分别从训练时技能记忆与推理时分析型记忆给出不同答案:一条把失败蒸馏成 skill bank 并反向塑造课表;一条把多模态观察物化成可查询表结构,支持聚合与时序比较。
对工程实践而言,这意味着记忆不再只是 RAG 检索层,而是同时改写策略学习、任务分布与查询执行图的一等公民。
cs.AI 新方法 有代码
arXiv:2607.29468 · Fu et al. · 2026-07-31
代码:SESA-Self-Evolving-Search-Agents
问题。Self-play 能自己出题,但课表没有持久状态——失败只进梯度,不显式塑造下次练习;外部 skill memory 往往在固定任务分布上学习,缺「出题—解题—记忆」闭环。
方法(技术原理)。SESA 把 procedural memory 做成 tool-augmented search self-play 的演化状态:
这是一个双向闭环:任务生成 ⇄ 技能记忆共演化。因为检索到的 skills 进入 on-policy 轨迹,收益可写入模型参数,部署时可 memory-free;也可在推理时继续挂 skill bank。
| 维度 | 做法 | 含义 |
|---|---|---|
| 角色分离 | Challenger / Solver 分参 | 避免出题方偷看 skill 捷径 |
| 写回触发 | informative failures → skill | 失败成为课表资产,而非只当 loss |
| 训练影响 | skills 进 on-policy 轨迹 | 外存可内化进权重(SESA-Off 仍保留增益) |
| 部署形态 | memory-free 或可选检索 | 训练期外存 ≠ 推理期强依赖 |
结果。7 个开放域 / 多跳 QA:相对 SSP 平均 +1.2~3.2 点;统一协议下超 SkillRL +0.9。Qwen3 上 SESA-Off 仍 +1.8~2.2,skill bank 再加 +0.5~1.0——说明演化记忆既改学习,也仍有外挂价值。
cs.AI 新架构 多模态
arXiv:2607.29440 · Tian et al. · 2026-07-31
问题。长期多模态记忆主流是 retrieval memory:摘要 + 索引,按 query 返回多粒度片段。但真实交互还需要对累积观察做计算——过滤、聚合、排序、时间对比——这不是「再找一段相似文本」能覆盖的。
方法(技术原理)。AdaMM 形式化 analytic memory 作为互补抽象:
| 记忆类型 | 组织方式 | 典型查询 | 算子 |
|---|---|---|---|
| Retrieval memory | 摘要 / 索引 / 多粒度记录 | 「上次讨论的那张图是什么」 | 相似度检索 |
| Analytic memory | 属性–值表 + 字段结构 | 「过去一周最常出现的品牌」 | filter / agg / rank / temporal |
结果。MemEye / MemGallery 上最高分别 +11.3% / +7.3%。相对 SESA 的「训练闭环」,AdaMM 更偏系统架构与查询规划:把记忆读路径从纯向量搜索扩展成「检索 + 分析」混合执行。
| 工作 | ID | 与主题关系 |
|---|---|---|
| Know It, Act on It | 2607.29433 | 解耦 Know vs Act:偏好在上下文里仍可能不被行为化;记忆「有」≠「用」 |
| AMTFV | 2607.29549 | 数学验证 agent:MTF interrupt–execute–resume,验证建模与精确计算解耦 |
| Evidence-Type Competition | 2607.29484 | 因果方向学习:能力在权重、开关在上下文;与「记忆是否被激活」同构 |
| OrchBench | 2607.25656 | 多 agent 编排隔离评测;强调保关键信息优于盲目加 agent |
| SkillRL / SSP 等 | — | SESA 直接基线:固定分布 skill 或无状态 self-play |
二级检索还指向 ACL 2026 向的推理失败动力学(如 2604.14528)与推理 scaling survey,说明「记忆写回 + 推理时算子」正与推理可靠性议题汇合。