
问题
LLM 助手已经被大量用于日常社交建议——从怎么回复同事到如何表达拒绝。但评测这类能力一直很难,原因有二:一是评测场景要求助手从用户的主观叙述中理解社交情境,二是“对方的意图”这类社交属性通常没有可验证的答案。
方法
9 月 15 日提交到 arXiv 的论文《Verifiable Social Reasoning for LLM Assistants》(arXiv:2609.17496)提出 Fuse,一个多智能体模拟框架:一个带有隐藏动机的目标智能体与其他智能体互动,其中包含代表用户的智能体;用户随后向被评测的助手咨询,要求其推断目标智能体的动机。因为动机是构造出来的,正确与否可以验证——地面真值由构造本身保证。
论文作者来自谷歌研究团队,包括谷歌副总裁玛丽安·克罗克与约西·马蒂亚斯。研究团队用 24,000 条人工标注校验了模拟的保真度,并将 Fuse 应用于 12 个 LLM。
发现
四个发现值得单独列出:
- 用户中介会加剧社会推理本身的难度;
- LLM 对带有偏见的用户叙述表现出系统性敏感——叙述怎么讲,比事实是什么更影响判断;
- 模型有时需要比人类更多的细节才能得出正确预测;
- 更长的对话并不总是带来更好的表现,尽管提供了更多澄清提问的机会。
研究团队已开源 Fuse 框架与包含 21,000 个样本的数据集。
局限
这是一篇 arXiv 预印本,尚未经过同行评审。评测任务的构造方式——隐藏动机由系统设定——与现实社交场景仍有距离:真实对话里,用户的目标往往连他们自己都说不清。但“构造即地面真值”这一思路,至少让社会推理评测第一次有了可复现的标尺。
[1]