深度调研:Agent 记忆两条路线——技能自演化与分析型记忆

2026-08-04 · 每日调研 · 来源 arXiv cs.AI / cs.CL(2026-07-31 批次)

为什么重要

Agent 系统的瓶颈正在从「会不会调工具」转向「会不会把经验变成可复用状态」。本周两篇同日投稿的工作,分别从训练时技能记忆推理时分析型记忆给出不同答案:一条把失败蒸馏成 skill bank 并反向塑造课表;一条把多模态观察物化成可查询表结构,支持聚合与时序比较。

对工程实践而言,这意味着记忆不再只是 RAG 检索层,而是同时改写策略学习、任务分布与查询执行图的一等公民。

核心结论:SESA 证明「演化中的 procedural memory」会进入参数并改变未来问题分布;AdaMM 证明「检索记忆」不够,Agent 还需要能 filter / aggregate / rank 的 analytic memory。两者合起来刻画了 2026 下半年 Agent 记忆设计的主轴:write path 的共演化 + read path 的算子化

核心论文解读

论文 1 · SESA:Self-Play 遇上技能演化

cs.AI 新方法 有代码
arXiv:2607.29468 · Fu et al. · 2026-07-31
代码:SESA-Self-Evolving-Search-Agents

问题。Self-play 能自己出题,但课表没有持久状态——失败只进梯度,不显式塑造下次练习;外部 skill memory 往往在固定任务分布上学习,缺「出题—解题—记忆」闭环。

方法(技术原理)。SESA 把 procedural memory 做成 tool-augmented search self-play 的演化状态

  1. Challenger 出题;Solver 单独参数化,且只有 Solver 检索 skills(信息隔离,防泄漏)。
  2. 有信息量的失败被蒸馏成可复用 skill,写回 memory bank。
  3. 更新后的 memory 改变 Solver 行为与成功率 → 改变 Challenger 奖励与未来问题分布 → 新 frontier 再产生新失败 → 再写 memory。

这是一个双向闭环:任务生成 ⇄ 技能记忆共演化。因为检索到的 skills 进入 on-policy 轨迹,收益可写入模型参数,部署时可 memory-free;也可在推理时继续挂 skill bank。

维度做法含义
角色分离Challenger / Solver 分参避免出题方偷看 skill 捷径
写回触发informative failures → skill失败成为课表资产,而非只当 loss
训练影响skills 进 on-policy 轨迹外存可内化进权重(SESA-Off 仍保留增益)
部署形态memory-free 或可选检索训练期外存 ≠ 推理期强依赖

结果。7 个开放域 / 多跳 QA:相对 SSP 平均 +1.2~3.2 点;统一协议下超 SkillRL +0.9。Qwen3 上 SESA-Off 仍 +1.8~2.2,skill bank 再加 +0.5~1.0——说明演化记忆既改学习,也仍有外挂价值。

注意:绝对涨幅不大(约 1–3 点),价值在机制而非刷榜。GitHub 刚上线、star 尚少,复现与稳定性需自行验证;skill 蒸馏质量决定闭环是否「越练越偏」。

论文 2 · AdaMM:超越检索的分析型记忆

cs.AI 新架构 多模态
arXiv:2607.29440 · Tian et al. · 2026-07-31

问题。长期多模态记忆主流是 retrieval memory:摘要 + 索引,按 query 返回多粒度片段。但真实交互还需要对累积观察做计算——过滤、聚合、排序、时间对比——这不是「再找一段相似文本」能覆盖的。

方法(技术原理)。AdaMM 形式化 analytic memory 作为互补抽象:

  1. 从对话、图像、上下文元数据中抽取带 provenance 的 attribute–value 观察;
  2. 发现 recurring field structure,物化为可分析访问的结构(类似轻量 schema discovery);
  3. 推理时 memory-aware planner 把 query 拆成 retrieval ops + analytic ops,路由到不同工具。
记忆类型组织方式典型查询算子
Retrieval memory摘要 / 索引 / 多粒度记录「上次讨论的那张图是什么」相似度检索
Analytic memory属性–值表 + 字段结构「过去一周最常出现的品牌」filter / agg / rank / temporal

结果。MemEye / MemGallery 上最高分别 +11.3% / +7.3%。相对 SESA 的「训练闭环」,AdaMM 更偏系统架构与查询规划:把记忆读路径从纯向量搜索扩展成「检索 + 分析」混合执行。

技术对照:SESA 的 memory 是 procedural(怎么搜、怎么解),在训练环里共演化;AdaMM 的 memory 是 declarative + tabular(见过什么、如何聚合),在推理环里被 planner 调度。一条改 write/curriculum,一条改 read/compute。

相关工作

工作ID与主题关系
Know It, Act on It 2607.29433 解耦 Know vs Act:偏好在上下文里仍可能不被行为化;记忆「有」≠「用」
AMTFV 2607.29549 数学验证 agent:MTF interrupt–execute–resume,验证建模与精确计算解耦
Evidence-Type Competition 2607.29484 因果方向学习:能力在权重、开关在上下文;与「记忆是否被激活」同构
OrchBench 2607.25656 多 agent 编排隔离评测;强调保关键信息优于盲目加 agent
SkillRL / SSP 等 SESA 直接基线:固定分布 skill 或无状态 self-play

二级检索还指向 ACL 2026 向的推理失败动力学(如 2604.14528)与推理 scaling survey,说明「记忆写回 + 推理时算子」正与推理可靠性议题汇合。

我的判断

  1. 可落地优先级:工程上先抄 AdaMM 的「planner 拆 retrieval/analytic」思路成本更低——多数 Agent 已有日志与结构化字段,差的是物化与聚合路由。SESA 需要 self-play RL 管线,适合已有 search agent 训练栈的团队。
  2. 关键设计原则:写路径要有「失败→可复用单元」的显式状态;读路径要承认一部分 query 是 SQL-like 而不是 embedding-like。两者缺一会分别表现为「课表不长进」和「记得住算不出」。
  3. 风险:skill 蒸馏噪声会污染课表;analytic schema 漂移会导致错误聚合。Know/Act 缺口提示:就算记忆命中,仍需行为约束或显式 act 头,否则个性化/健康类偏好最容易「知道却不执行」。
  4. 观察点(未来 2–4 周):SESA 代码是否补齐训练脚本与可复现数字;是否有工作把 procedural skill bank 与 analytic tables 统一成同一 memory OS。
筛选说明:两篇均以「新架构/方法」入选。SESA 虽开源,仓库 star 尚低(截至抓取时极少),不满足 stars>500 条;AdaMM 未见官方大规模代码发布声明。结论基于摘要与公开元数据,未复现实验。

参考链接