Harness-Native Agent 训练的崛起:OpenForgeRL 与上下文压缩前沿

2026-07-24 · 每日调研 · 焦点:Agent 训练栈 / RL with harness / 上下文管理 / 多模态推理

为什么重要 2026 年下半年 agent 研究的两条主线——训练栈上下文栈——开始合流。一边是 OpenForgeRL 把 Claude Code / Codex / OpenClaw 这类"带状态、带工具、带进程"的 harness 当成 SFT/RL 的一等公民来训;另一边是 Agentic Context Management (ACM) 提出"上下文是 lifecycle,不是 store"。两条线一旦合流,意味着 agent 训练范式从"训一个能聊天的模型"变成"训一个能在真实 harness 里长期跑工程的智能体"。本期选取 3 篇代表性论文拆解这一趋势。

核心判断 2026 年下半年的 agent 论文普遍绕开了"模型层"的胜负,把注意力投到了训练-部署一致性运行时记忆机制这两个过去被忽视的中间层。这是从"研究 demo"到"生产可用"的关键拐点。

核心论文解读

1. OpenForgeRL:在任意环境中训练 Harness-Native Agent

arXiv:2607.21557cs.AI开源 RL 框架

作者 OpenForgeRL 团队(论文提到 Claude Code、Codex、OpenClaw、ZeroClaw 等 harness)

核心问题 当代 agent 严重依赖 harness(多轮推理、工具调用、外部系统接入),但开源 SFT/RL 栈(veRL 等)原生不能表达"有状态、多进程"的 harness 推理,导致端到端训练几乎不可行。

关键设计

关键结果

模型变体Benchmark得分
OpenForgeClawClawEval (pass^3)31.7
OpenForgeClawClawEval (pass@3)55.9
OpenForgeClawQwenClawBench33.7
OpenForgeGUIOSWorld-Verified37.7
OpenForgeGUIOnline-Mind2Web63.0
OpenForgeGUIWebVoyager72.3

开源基线在几乎所有基准上被超越;GUI 设置下小尺寸模型可以追平/超越几倍大小的对手。

论文洞察 "不同 harness 的可学习性差距显著"。同一 RL 算法换到 ZeroClaw / OpenClaw / Codex 表现差异很大——意味着 agent 行为上限不只取决于 base model 与 RL 算法,harness 本身就是一个需要设计的变量

局限性

论文链接 arXiv:2607.21557

2. Agentic Context Management(ACM):把上下文当成 lifecycle 而不是 store

arXiv:2607.21503cs.AI生产 agentMaximem Synap

核心问题 生产 agent 的失败更多不是"推理不行",而是"管不住自己脑子里有什么"。对话历史、巨型 prompt、工具定义、膨胀的工具输出每轮都在消耗 token;朴素累积让成本与对话长度呈平方增长。

ACM 五原语

  1. Architecting ——为不同数据类型选择正确的存储与访问模式。
  2. Ingesting ——把对话/工具输出转成结构化表征。
  3. Scoping ——按组织-用户层级界定可见性边界。
  4. Anticipating ——预判下一步需要什么,主动拉取。
  5. Compacting & Consolidation ——在预算内压缩上下文,保持保真度。

经济账

策略Token 成本随对话长度精度损失
朴素累积O(N²)
粗粒度摘要O(N)悬崖式跌落
已验证压缩(validated compaction)O(N)保持保真

参考实现 Maximem Synap,多租户服务化的五原语实现。

论文链接 arXiv:2607.21503

3. MIRROR:让 VLM 在不同模态视图间互教

arXiv:2607.21552cs.AI / cs.LG多模态 RL

核心问题 VLM 在几何问题上常常"能看懂文本但看不懂图"或反之。同一个问题在不同模态视图(文本主导 / 图像主导 / 图文并茂)下表现不稳,说明视图间存在互补推理路径与失败模式,但标准多模态后训练没有利用这种互补。

两个贡献

机制亮点 "哪个视图答得最好就用哪个视图当老师,再用 reverse-KL 让其他视图贴近"。reverse-KL 的 mode-seeking 倾向恰好避免了多模态答案坍缩到 teacher 的次优解。

局限性

论文链接 arXiv:2607.21552

相关工作

论文主题与本期关联
RR-Bench (2607.21482)本地开源 LLM 做纵向数据准备,31-35B 模型饱和 87.9% 任务补充"agentic coding without the cloud"——OpenForgeRL 的本地化场景下沉
Token-level LLM 检测 (2607.21458)token 级 LLM 生成内容定位,自适应 Lepski 带宽coauthored text 场景下与 ACM 的"组织级上下文作用域"互补
Same Dangerous Objective (2607.21518)多 agent 流水线中的组合式安全漏洞为 OpenForgeRL 的 proxy 训练机制补一记安全警告:trajectory 拦截层也是攻击面
Continuous Assurance (2607.21495)低代码 agent 民主化下的持续可保证性框架与 ACM 的 organizational scoping 同源——都在做"运行时治理"
Beyond Sycophancy (2607.21558)LLM 道德推理中的结构化抵抗/顺从为 harness-native agent 增加 social influence 维度的对齐研究
Structured Audio Captions (2607.21424)DCASE 2026,结构化音频描述五轴评估提供 MIRROR 风格的"跨模态评估框架"参照

我的判断

趋势定调 agent 研究已经从"谁家 base model 更强"转向"中间层——训练栈对齐(OpenForgeRL)、上下文管理(ACM)、多模态一致性(MIRROR)。这三篇放在一起就是一张完整的"生产级 agent 改造图":底层是 base model,中间是 harness + context engine,上层是 cross-modal reasoning。

1. OpenForgeRL 是这个月最值得跟进的工程实践 它真正解决了"想训 agentic 模型但没 harness 内训练栈"的卡脖子问题。Proxy + K8s rollout 的解耦思路非常工程化——任何一家已有 veRL 的实验室都能复用。值得 JC 关注的是其"harness 可学习性差异显著"的发现:同一模型在不同 harness 下 RL 收益可能差 30%+。这意味着评估 agent 不能脱离部署环境。

2. ACM 的"lifecycle"框架是把现有 RAG/记忆方案往前推了一格 市面上的 MemGPT / A-Mem / Letta 主要做 store-and-retrieval,ACM 强调"what to remember → how to store → when to consolidate"是生命周期。这个区别看起来抽象,但在生产里的体现非常具体:

JC 在做 picturebook-kg 的时候已经踩过 context 过长的坑,verified compaction 这条路线值得直接引入到项目里的清洗 pipeline。

3. MIRROR 的方法论意义大于当前结果 它示范了一种"跨视图自监督"的范式:在没有 ground-truth 的情况下,让模型的不同视图互相校正。这种思路未来可外推到跨工具视图(同一 agent 在不同 harness/工具组合下的行为对齐)、跨用户视图(同一 agent 在不同 persona 下的响应对齐)。

风险提示 三篇论文的实验规模都还是"几百到几千任务"级(OpenForgeRL 用数百到几千任务;ACM 的 LongMemEval 评估集也是限定规模)。从"benchmark 显著"到"生产可用"还有相当距离——尤其是错误恢复(OpenForgeRL 自承的薄弱项)与长程一致性(ACM 没充分压测的多月级会话)。

下一步建议