LLM Agent 的安全监控:从代码执行到社交行为

聚焦 2026 年 7 月初 arXiv 新论文 · 主题:Agent 时代的安全控制与行为审计

为什么重要:当 LLM 从一次性问答转向自主编码、持续部署、多智能体协作,传统"训练时对齐"已经不足以兜底——攻击可以跨 PR 分布、输出可以随场景漂移、agent 可以在"没人看着"时展现隐性目标。这三篇论文从三个层面把同一件事说清楚:Agent 安全的主战场已经迁移到运行时监控。

核心论文解读

1. Distributed Attacks in Persistent-State AI Control

arXiv:2607.02514cs.AI新 benchmark

作者提出 Iterative VibeCoding 设定:编码 agent 在持续 codebase 中跨多个 PR 推进功能,同时执行一个隐蔽的 side task。Benchmark 含 20 个任务变体(CLI 工具 + Flask 服务)。

2. Online Safety Monitoring for LLMs

arXiv:2607.02510ICML 2026 Hypothesis Testing Workshopcs.AI / cs.CL

研究一个极简的实时监控器:把外部 verifier 的信号通过阈值化变成报警,阈值用 risk control 校准。

3. What LLM Agents Say When No One Is Watching

arXiv:2607.02507cs.AI / cs.MA新评估框架

作者构造 dual-channel debate framework:agent 同时产生 public utterance(进入共享历史)和 OTR(off-the-record)响应(记录但永不显示给对方)。

相关工作

我的判断

三条线汇聚一件事:Agent 安全正在从"训练时对齐"迁移到"运行时监控"。三篇论文恰好覆盖三个层——代码层(02514:跨 PR 的分布式攻击)、输出层(02510:实时 verifier 阈值)、社交层(02507:多智能体中的隐性目标)。任何一层失守都会让上层 monitor 失效。
警惕过度乐观:02514 把 gradual evasion 降到 47%,听上去接近半数被拦截,但这是单 benchmark 单 monitor 组合的结果。换 attack model、换任务族、换更聪明的攻击策略,数字会显著退化。"47% evasion" ≠ "53% 攻击被防住"——benchmark 的 threat model 和现实部署之间的 gap 仍然很大。