9 月 16 日提交到 arXiv 的《Closed-World Resolution Against Tool Hallucination in LLM Agents》(2609.19425,作者 Laxmipriya Ganesh Iyer)研究一个所有 agent 团队迟早会撞上的失败模式:模型调用了一个根本不存在的工具,传入了任何 schema 都没声明的参数。论文的核心论点很尖锐——现有的两类防御(选择正确的工具、或约束 agent 对真实工具的使用权限)都预设了"模型发出的调用指向真实工具",而幻觉调用按构造就不是任何门控系统做过的决定,所以没有任何门控能拒绝它。这是一个结构性盲区。

先看测量。论文在 10 个托管模型、两个调用接口上测量出 322 个真实工具幻觉;捏造工具调用高度集中在无约束的 raw-JSON 接口上(34 次对 3 次);更关键的是,模型规模没有帮助——一个 675B 的模型与 7-8B 的模型表现相当。这直接否定了"更大模型自然更少幻觉"的直觉:工具幻觉不是能力问题,是调用面的结构性属性。

论文给出一个五类幻觉分类法(H1-H5),并提出一个参考实现 Resolution Rung:训练无关、闭世界解析器(注册表成员资格加签名检查)。它证明幻觉防御必须先于任何因果门控存在,并刻画了唯一不可约的残差——借用参数与合法调用在 schema 层面不可区分。工程翻译:你可以在注册表层面拦截"调用不存在的工具",但"用合法参数调用错误工具"没有干净的闭世界解法。

论文最有攻击性的部分在 Model Cont

[1]

ext Protocol(MCP)扩展。把多个 MCP server 合并进同一个命名空间,会创造出单一注册表无法表达的新幻觉面(第二分类 M1-M5):工具名冲突与遮蔽是合并的结构性结果,而非实现缺陷。在真实 MCP 接口上测量到 154 个幻觉,其中包括在单注册表接口上表现干净的前沿模型。这意味着:MCP 生态越繁荣,这种"合并即引入漏洞"的问题越普遍。

局限要交代:这是测量与基准研究(方法论文),322 与 154 两个数字取决于测试集与调用面设计;Resolution Rung 是"参照点"而非产品级防御,论文自己的兴趣在"它必须坐在哪一层",不在"它算得多好";借用参数的不可约残差意味着该路线有明确天花板。论文发布版本化的 Hallucinated-Tools Benchmark(HTB),任何解析器都可以跨提交比较。

对正在搭 agent 基建的团队,这篇论文的实用价值有三:第一,别把工具幻觉当"模型不够聪明"——换更大的模型大概率无效;第二,在工具调用的入口放一个闭世界注册表检查,成本低、收益确定;第三,如果用了 MCP 合并多个 server,要把它当作新的安全面来审计,而不是当作配置细节。

[1]
深夜的服务器机房运维通道,一名运维工程师的背影站在机柜前,手持平板显示一排工具调用日志,其中几条条目被红色高亮标为未知工具名,机柜指示灯闪烁,通道尽头有微弱的冷光,散热风扇叶片转动
深夜机房工具调用日志审计的编辑级插画, AI 生成插画,非新闻照片