为什么重要 2026 年下半年 agent 研究的两条主线——训练栈与上下文栈——开始合流。一边是 OpenForgeRL 把 Claude Code / Codex / OpenClaw 这类"带状态、带工具、带进程"的 harness 当成 SFT/RL 的一等公民来训;另一边是 Agentic Context Management (ACM) 提出"上下文是 lifecycle,不是 store"。两条线一旦合流,意味着 agent 训练范式从"训一个能聊天的模型"变成"训一个能在真实 harness 里长期跑工程的智能体"。本期选取 3 篇代表性论文拆解这一趋势。
核心判断 2026 年下半年的 agent 论文普遍绕开了"模型层"的胜负,把注意力投到了训练-部署一致性与运行时记忆机制这两个过去被忽视的中间层。这是从"研究 demo"到"生产可用"的关键拐点。
arXiv:2607.21557cs.AI开源 RL 框架
作者 OpenForgeRL 团队(论文提到 Claude Code、Codex、OpenClaw、ZeroClaw 等 harness)
核心问题 当代 agent 严重依赖 harness(多轮推理、工具调用、外部系统接入),但开源 SFT/RL 栈(veRL 等)原生不能表达"有状态、多进程"的 harness 推理,导致端到端训练几乎不可行。
关键设计
关键结果
| 模型变体 | Benchmark | 得分 |
|---|---|---|
| OpenForgeClaw | ClawEval (pass^3) | 31.7 |
| OpenForgeClaw | ClawEval (pass@3) | 55.9 |
| OpenForgeClaw | QwenClawBench | 33.7 |
| OpenForgeGUI | OSWorld-Verified | 37.7 |
| OpenForgeGUI | Online-Mind2Web | 63.0 |
| OpenForgeGUI | WebVoyager | 72.3 |
开源基线在几乎所有基准上被超越;GUI 设置下小尺寸模型可以追平/超越几倍大小的对手。
论文洞察 "不同 harness 的可学习性差距显著"。同一 RL 算法换到 ZeroClaw / OpenClaw / Codex 表现差异很大——意味着 agent 行为上限不只取决于 base model 与 RL 算法,harness 本身就是一个需要设计的变量。
局限性
论文链接 arXiv:2607.21557
arXiv:2607.21503cs.AI生产 agentMaximem Synap
核心问题 生产 agent 的失败更多不是"推理不行",而是"管不住自己脑子里有什么"。对话历史、巨型 prompt、工具定义、膨胀的工具输出每轮都在消耗 token;朴素累积让成本与对话长度呈平方增长。
ACM 五原语
经济账
| 策略 | Token 成本随对话长度 | 精度损失 |
|---|---|---|
| 朴素累积 | O(N²) | 无 |
| 粗粒度摘要 | O(N) | 悬崖式跌落 |
| 已验证压缩(validated compaction) | O(N) | 保持保真 |
参考实现 Maximem Synap,多租户服务化的五原语实现。
论文链接 arXiv:2607.21503
arXiv:2607.21552cs.AI / cs.LG多模态 RL
核心问题 VLM 在几何问题上常常"能看懂文本但看不懂图"或反之。同一个问题在不同模态视图(文本主导 / 图像主导 / 图文并茂)下表现不稳,说明视图间存在互补推理路径与失败模式,但标准多模态后训练没有利用这种互补。
两个贡献
机制亮点 "哪个视图答得最好就用哪个视图当老师,再用 reverse-KL 让其他视图贴近"。reverse-KL 的 mode-seeking 倾向恰好避免了多模态答案坍缩到 teacher 的次优解。
局限性
论文链接 arXiv:2607.21552
| 论文 | 主题 | 与本期关联 |
|---|---|---|
| RR-Bench (2607.21482) | 本地开源 LLM 做纵向数据准备,31-35B 模型饱和 87.9% 任务 | 补充"agentic coding without the cloud"——OpenForgeRL 的本地化场景下沉 |
| Token-level LLM 检测 (2607.21458) | token 级 LLM 生成内容定位,自适应 Lepski 带宽 | coauthored text 场景下与 ACM 的"组织级上下文作用域"互补 |
| Same Dangerous Objective (2607.21518) | 多 agent 流水线中的组合式安全漏洞 | 为 OpenForgeRL 的 proxy 训练机制补一记安全警告:trajectory 拦截层也是攻击面 |
| Continuous Assurance (2607.21495) | 低代码 agent 民主化下的持续可保证性框架 | 与 ACM 的 organizational scoping 同源——都在做"运行时治理" |
| Beyond Sycophancy (2607.21558) | LLM 道德推理中的结构化抵抗/顺从 | 为 harness-native agent 增加 social influence 维度的对齐研究 |
| Structured Audio Captions (2607.21424) | DCASE 2026,结构化音频描述五轴评估 | 提供 MIRROR 风格的"跨模态评估框架"参照 |
趋势定调 agent 研究已经从"谁家 base model 更强"转向"中间层——训练栈对齐(OpenForgeRL)、上下文管理(ACM)、多模态一致性(MIRROR)。这三篇放在一起就是一张完整的"生产级 agent 改造图":底层是 base model,中间是 harness + context engine,上层是 cross-modal reasoning。
1. OpenForgeRL 是这个月最值得跟进的工程实践 它真正解决了"想训 agentic 模型但没 harness 内训练栈"的卡脖子问题。Proxy + K8s rollout 的解耦思路非常工程化——任何一家已有 veRL 的实验室都能复用。值得 JC 关注的是其"harness 可学习性差异显著"的发现:同一模型在不同 harness 下 RL 收益可能差 30%+。这意味着评估 agent 不能脱离部署环境。
2. ACM 的"lifecycle"框架是把现有 RAG/记忆方案往前推了一格 市面上的 MemGPT / A-Mem / Letta 主要做 store-and-retrieval,ACM 强调"what to remember → how to store → when to consolidate"是生命周期。这个区别看起来抽象,但在生产里的体现非常具体:
JC 在做 picturebook-kg 的时候已经踩过 context 过长的坑,verified compaction 这条路线值得直接引入到项目里的清洗 pipeline。
3. MIRROR 的方法论意义大于当前结果 它示范了一种"跨视图自监督"的范式:在没有 ground-truth 的情况下,让模型的不同视图互相校正。这种思路未来可外推到跨工具视图(同一 agent 在不同 harness/工具组合下的行为对齐)、跨用户视图(同一 agent 在不同 persona 下的响应对齐)。
风险提示 三篇论文的实验规模都还是"几百到几千任务"级(OpenForgeRL 用数百到几千任务;ACM 的 LongMemEval 评估集也是限定规模)。从"benchmark 显著"到"生产可用"还有相当距离——尤其是错误恢复(OpenForgeRL 自承的薄弱项)与长程一致性(ACM 没充分压测的多月级会话)。
下一步建议