编辑出版级科技插画:中央发光白色节点代表被评测的 AI 助手,周围环绕大小不一的灰色与淡蓝色节点,一条琥珀橙连线标出用户转述的关键路径
Fuse 框架的多智能体对话网络(AI 生成插画), AI 生成插画,非论文原图

问题

LLM 助手已经被大量用于日常社交建议——从怎么回复同事到如何表达拒绝。但评测这类能力一直很难,原因有二:一是评测场景要求助手从用户的主观叙述中理解社交情境,二是“对方的意图”这类社交属性通常没有可验证的答案。

方法

9 月 15 日提交到 arXiv 的论文《Verifiable Social Reasoning for LLM Assistants》(arXiv:2609.17496)提出 Fuse,一个多智能体模拟框架:一个带有隐藏动机的目标智能体与其他智能体互动,其中包含代表用户的智能体;用户随后向被评测的助手咨询,要求其推断目标智能体的动机。因为动机是构造出来的,正确与否可以验证——地面真值由构造本身保证。

论文作者来自谷歌研究团队,包括谷歌副总裁玛丽安·克罗克与约西·马蒂亚斯。研究团队用 24,000 条人工标注校验了模拟的保真度,并将 Fuse 应用于 12 个 LLM。

发现

四个发现值得单独列出:

  • 用户中介会加剧社会推理本身的难度;
  • LLM 对带有偏见的用户叙述表现出系统性敏感——叙述怎么讲,比事实是什么更影响判断;
  • 模型有时需要比人类更多的细节才能得出正确预测;
  • 更长的对话并不总是带来更好的表现,尽管提供了更多澄清提问的机会。

研究团队已开源 Fuse 框架与包含 21,000 个样本的数据集。

局限

这是一篇 arXiv 预印本,尚未经过同行评审。评测任务的构造方式——隐藏动机由系统设定——与现实社交场景仍有距离:真实对话里,用户的目标往往连他们自己都说不清。但“构造即地面真值”这一思路,至少让社会推理评测第一次有了可复现的标尺。

[1]