9 月 17 日提交到 arXiv 的一篇预印本(编号 2609.20543,单作者 Tengfei Shao)给"用 LLM 智能体群体模拟人类群体审议"这个日益流行的做法泼了一盆冷水。研究者复演了 100 个真实的人类 Wason 选择任务小组,用匹配的 LLM 智能体小组按相同流程重跑,并用同一套代码给人类与智能体打分——结论是:智能体小组系统性高估共识,而且它们的"一致"并不跟踪正确率。
方法上,这篇论文做得相当严谨。每个参与者讨论前的答案被植入一个信念锚定的智能体(belief-anchored agent);讨论协议与打分代码对人类和智能体完全一致;研究在预注册框架下进行(37 页、4 图)。人类小组的完全共识率本身就很依赖计分口径——在不同定义下从 24.0% 到 57.0% 浮动;约五分之一的人类参与者从不发言,而智能体几乎总是发言。
核心结果来自两条互补的补盲敏感性分析。在 submit-based 比较(n=98)里,智能体小组与人类小组的共识率差距为 chat 模式 34.0 个百分点、reasoning 模式 43.9 个百分点;在 participation-matched 比较(n=45)里,差距为 34.1 与 44.4 个百分点。两条路径消除了不同的测量不对称,却收敛在 0.5 个百分点以内——作者据此判断,高估共识不是打分方法的产物,而是行为差异本身。
更值得警惕的是后两组对照。移
[1]除"早停"后差距依然存在;在重新参数化、去掉可记忆答案之后,reasoning 模式的智能体小组几乎达成全体一致——而多数时候,它们一致同意的是错误答案。模拟共识不跟踪集体准确率;信念锚定的智能体群体,是对人类群体结果分布的有偏估计(biased estimator)。换句话说,一群 LLM 的"一致"既不等于"正确",也不等于"像人类"。
这篇论文的边界要交代清楚:单作者、单任务(Wason 选择任务)、单轮审议;信念锚定的植入方式是否公平地代表了人类认知,本身可以争论;智能体"几乎总是发言"的行为也与人类参与者的沉默模式不同。它没有证明"AI 群体模拟无用",它证明的是:如果研究者把"共识度"当作群体认知健康的指标,会被系统性误导——智能体的一致性更多来自架构的趋同性,而不是推理的说服力。
对快速膨胀的"AI 社会模拟"与预测市场应用来说,这是个方法论警告:当模拟群体比人类更容易达成一致时,一致本身作为信号的价值就下降了。论文作者把话留在结论里:要为"模拟群体对人类审议结果的估计"提供可打分的依据——先证明它们像人类,再谈它们能替人类决策。
[1]