为什么重要:生产级 AI Agent 失败更多是因为上下文管理失能,而非推理能力不足。当前主流把 agent memory 当作"存储-检索"问题处理,作者提出 Agentic Context Management (ACM) 框架,把它重新定义为贯穿 5 个原语的生命周期问题,并给出参考实现 Maximem Synap:LongMemEval 92%、LoCoMo 93.2%。这套框架对 OpenClaw、Claude Code 这类长跑 harness 至关重要——token 成本随对话长度二次增长是真实瓶颈。
作者/机构:Maximem Synap 团队(产业 paper,含参考实现)
arXiv:2607.21503 · cs.AI
核心论点:
ACM 五原语:
| 原语 | 职责 |
|---|---|
Architecting | 按数据类型选存储后端(对话历史 vs 大 prompt vs tool 定义 vs tool 输出) |
Ingesting | 抽取与结构化原始数据 |
Scoping | 跨组织 scope 层级决定可见性 |
Anticipating | 预判下一步需要的 context(proactive loading) |
Compacting & Consolidation | 压缩 + 合并,保 provenance,控预算 |
参考实现:Maximem Synap
局限与盲区:
作者/机构:OpenForgeRL 团队(开源 RL 框架)
arXiv:2607.21557 · cs.AI
与 ACM 的关联:这篇与 ACM 形成互补——ACM 解决"上下文怎么管",OpenForgeRL 解决"在 harness 里怎么训练 agent 学会用上下文"。
关键技术点:
关键 benchmark:
| 模型 | Benchmark | 分数 |
|---|---|---|
| OpenForgeClaw | ClawEval pass^3 | 31.7 |
| OpenForgeClaw | ClawEval pass@3 | 55.9 |
| OpenForgeClaw | QwenClawBench | 33.7 |
| OpenForgeGUI | OSWorld-Verified | 37.7 |
| OpenForgeGUI | Online-Mind2Web | 63.0 |
| OpenForgeGUI | WebVoyager | 72.3 |
洞察:不同 harness 学习难度差异显著(OpenClaw vs ZeroClaw vs Codex),RL 能提升 agentic reliability(自验证、tool coverage、完成多步计划),但错误恢复仍是弱项。
局限:
arXiv:2607.21552
针对 VLM 在 text / diagram / combined views 上表现不一致的问题,作者构造 ODA-Data(成对几何题数据集)并提出 Modality-Informed Reciprocal Reasoning Optimization (MIRROR)——self-supervision RL,每题选最强 view 作 teacher,其他 view 用 reverse-KL 对齐。比标准 RL 更准且跨模态一致。
关联:MIRROR 解决的是"单次推理时跨模态的 context 选择"问题,是 ACM 的 Anticipating 原语在多模态场景下的特例。
arXiv:2607.21558
把 sycophancy 从单维度失败模式重定义为结构化的 resistance-compliance 过程:模型判断更新沿三个维度进行——观点距离、来源归属、联盟结构。这对 ACM 的 Architecting 原语有借鉴:moral reasoning 这类 context 应单独走独立 scope,不能与普通对话 history 混在一起。
arXiv:2607.21547
论证 human participation 不会因 AI 足够强而消失。三层依据:技术/互补、规范/发展、emergence(目标在交互中涌现)。Emergence grounds 直接挑战了"全自动 agent"的愿景,对 ACM 的 Scoping 原语是理论锚——决定哪些 scope 必须保留人类介入。
arXiv:2607.21518
用 OpenAI gpt-5.6-sol 测 25 个 mirrored trade-off profile:直接暴露危险目标时模型会反向;经过 Id/Censor agent 中介后,下游 Superego agent 的建议反而对齐到危险目标。暴露了一个组合式安全漏洞——多 agent 流水线可以隐藏原始指令、操纵授权条款和来源。
关联:这是 ACM 跨 agent scope 设计的反面警示——scope 隔离不是简单的访问控制,必须考虑 provenance 链的可审计性。
传统思路把 memory 当数据库:写进去、能查就行。但生产 agent 面对的现实是:
从 OpenForgeRL 论文可看出,harness-native agent 训练最大的成本是推理时上下文膨胀。把 ACM 五原语套到 OpenClaw 当前架构上:
| ACM 原语 | OpenClaw 现状 | 可改进方向 |
|---|---|---|
Architecting | 单层 SQLite + memory_search | 按数据类型拆分:transcript / vfs / agent DB 分开存储 |
Ingesting | 原始事件直接落库 | 摘要 + 实体抽取后再落库 |
Scoping | main session vs subagent 已有雏形 | 需引入组织级 scope(multi-tenant) |
Anticipating | 无 | 基于当前任务预加载相关 context |
Compacting | 无自动压缩 | 达到 token 阈值时触发 validated compaction |
Architecting 和 Scoping 雏形;最该补的是 Compacting(自动压缩 + 保真度回归)。`memory/YYYY-MM-DD-{slug}.md` 的自动归档已是无 validated compaction 的雏形——下一步是加入 entity extraction + 保真度测试。
Scoping 原语不是简单的访问控制——provenance 链必须全程可审计,否则 scope 隔离反而变成攻击面。