研究复现100场人类讨论:AI 智能体组共识率虚高,常一致地错
alex_verem · x · 2026-10-07
早稻田大学研究员 Tengfei Shao 的 arXiv 论文(2609.20543)用 LLM 智能体复现了 100 场真实人类 Wason 逻辑卡片小组讨论,每位参与者用其讨论前答案锚定一个智能体。
核心发现:
- 智能体小组在逻辑谜题上一致率高达 98.7%,但其中约 74% 的小组一致选了错误答案
- 人类真实小组的全共识率仅约 24%-57%,且约五分之一参与者从不发言;智能体则几乎总是发言
- 提交口径对比下,chat 与 reasoning 模式的共识率差距分别达 34.0 和 43.9 个百分点;参与度匹配对比下结论一致,两条路线误差收敛在 0.5 个百分点内
- 即使去掉可被记忆的答案、不提前停止,差距依然存在;reasoning 模式组几乎全票通过——但多数是错的
结论:模拟讨论的共识度并不代表集体正确性,信念锚定的智能体小组是人类小组结果的有偏估计。用「AI 复现人群讨论」做社会模拟的研究者需要警惕这种虚假共识。
所属事件:早稻田研究警示:AI 焦点小组共识率高但常一致出错(2 条相关)→
「漫话AGI」频道最新
- 律师趣评:GPT 像贫民窟长大的孩子,Claude 像精英家庭的乖学生 — repligate · 2026-10-07
- 「机器翻译已经被悄悄解决了」:Reddit 热议被忽视的 AI 里程碑 — LostBetsRed · 2026-10-07
- e/acc 宣布建卡尔达肖夫等级实时观测台,并开放一个工程席位 — whurley · 2026-10-07
- AI 解 Navier–Stokes 引发数学界内战,8000 学者联名反对Fields奖得主 — kiankatan · 2026-10-07
- 数学家谈 LLM 使用规范:过渡期无共识,抢首发难获认可 — littmath · 2026-10-07
- 黄仁勋成 AI 末日论最大反方:称 Altman、Amodei 叙事「不负责任」 — AlexTensor · 2026-10-07