一篇 9 月 17 日提交、已预注册的 arXiv 论文(arXiv:2609.20543)做了个直接实验:把 100 个保留的人类 Wason 群组讨论原样"重放"给匹配的 LLM agent 群组,用同一套代码给人和模型打分。结论直白:模型群组系统性夸大共识——在某些设定下,人类全共识率与模型全共识率的差距达到 34 到 44 个百分点。

[1][2]

方法上,这篇论文把"度量怎么算"当成研究问题本身,而不是背景。研究者给每个 agent 播种一个参与者在讨论前的答案(信念锚定),然后让 agent 群复演同一段人类讨论;人与模型用同一套代码评分。先看人类这边的口径敏感性:全共识率估计值在 24.0% 到 57.0% 之间跳动,取决于"参与"和"终态"怎么定义——约五分之一的参与者从不发言,而 agent 几乎总是发言。换句话说,"共识率"这个数本身就随评分定义剧烈变化,这是作者想暴露的第一个问题。

然后才是模型对比。两条互补的灵敏度路径得出一致结论:基于提交的比较(n=98)中,聊天与推理两种模式下模型群共识率比人类高 34.0 与 43.9 个百分点;匹配参与度的比较(n=45)中差距是 34.1 与 44.4 点——两条路径收敛在 0.5 个百分点以内。更麻烦的是后面几个变体:去掉早停、重参数化移除可记忆答案后差距依旧;推理模式下模型群几乎全票一致,而一致的对象大多是错误答案。论文的核心发现由此成立:模拟共识并不追踪集体准确率,信念锚定的 agent 群在这一设定下对人类群体结果分布是有偏的估计量——它们不仅夸大共识,还让"高共识"和"正确"解绑。

这篇论文值得读,不是因为它发现了 LLM 会从众——这已经是共识——而是它把"用 LLM 群模拟人类群体"这个正在工业化的做法钉在测试台上。从市场调研、政策咨询到陪审团模拟,把 agent 群当人类群替代品的前提是"分布足够接近";论文的预注册设计与双重灵敏度分析说明,至少在这个推理任务上,替代品会系统地制造"大家意见高度一致"的假象,而一致度本身对错题毫无区分力。局限也要说清:单任务(Wason 选择任务)、单模型配置、评分定义高度敏感(这既是发现也是软肋),以及"有偏估计"的结论限定在这一设定;但正因为它把测量过程全部公开,后续研究可以直接复现或反驳。

[1][2]
深夜的观察实验室,一名研究员背影站在单向玻璃前:左侧房间是人类小组围着白板讨论、纸上画着逻辑图,右侧房间是一排亮屏的 AI 终端,每块屏幕都显示同一枚表示一致的绿色勾选图标,研究员手中的记录本上画着一条虚高的曲线
被夸大的共识, AI 生成插画,非新闻照片