一篇 9 月 21 日提交的 arXiv 论文(arXiv:2609.24662)质疑了 agent 安全评测的一个默认前提:现有评测大多假设用户被动、控制静态,而真实 agent 环境里用户和 agent 都在改变共享环境状态。研究者据此提出 DUMA-Bench——一个"双控制"交互下的多智能体安全基准,并给出一个刺眼的数字:引入双控制交互后,攻击成功率从 26.9% 升到 41.1%。

[1][2]

先拆方法。DUMA-Bench 扩展自 τ²-bench,覆盖八个漏洞类别,包括 RAG 投毒、跨 agent 操纵、不安全输出处理——注意这已经不是"模型会不会说错话"的静态测试,而是"agent 在拿真实工具干活时会不会被环境里的坏数据带着走"。评测了五个模型家族的 14 个模型(OpenAI、Anthropic、DeepSeek、Qwen 等),横跨八个领域和多种用户行为模式。核心变量是"双控制":允许用户一侧也改变环境状态,模拟真实世界里用户点错链接、粘错文本、被钓鱼邮件骗着把恶意指令喂给 agent 的情形。

结果对行业是个坏消息兼提醒。攻击成功率从 26.9% 跳到 41.1%——提高的 14.2 个百分点,不是模型变弱了,而是评测更真实了。论文的核心论断是:agent 安全不是模型单独的性质,而是模型、用户与环境三者交互的涌现属性。这句话听起来像学术套话,但落到工程上很具体:一个在静态评测里安全的 agent,放到一个会乱点链接的真实用户手里,可能一点都不安全;安全团队只测模型不改用户行为入口,等于只修了一半。

这篇论文的价值在于补上了一层"缺失的评测"。ARB/红队/越狱测试测的是模型对恶意输入的抵抗力,DUMA-Bench 测的是"真实部署形态"下的安全性——包括用户把 agent 带进坑里的场景。局限也要说清:攻击成功率是基准整体口径,不同领域与模型族的表现差异论文并未逐项展开;τ²-bench 的任务分布决定了覆盖范围;双控制虽然更真实,但"用户行为模式"本身是被研究者模拟的,真实用户的恶意程度分布仍有不确定性。整体上它给 agent 安全评测提供的是一个新测量层,而不是最终答案。

[1][2]
深夜的安全实验室,一名研究员背影坐在两排屏幕前:左侧屏幕显示正常的 agent 与用户对话窗口,右侧屏幕显示一条红色警报轨迹穿过模拟环境的界面,桌面键盘旁放着一枚红色按键,机柜指示灯在背景闪烁
双控制攻击面, AI 生成插画,非新闻照片