早稻田实验:AI 智能体小组 98.7% 达成一致,其中 74% 一致地错
alex_verem · x · 2026-10-07
早稻田大学研究者用真实人群的群体讨论数据测试「AI 替身焦点小组」的可靠性,结果敲响警钟:
- 实验设计:取 100 场真人求解四卡片逻辑谜题的小组讨论,为每位参与者创建 AI twin(基于 DeepSeek V4 Flash),从其原始答案出发重演讨论。
- 一致性≠正确:AI 智能体小组在 98.7% 的情况下达成一致,但其中 74% 的小组一致地得出错误答案。真人组在 45 个全员发言的小组中只有 51.1% 达成一致。
- 思考模式的影响:开思考模式后模型达成一致率 95.6%,关掉为 85.2%。
- renaming 测试:把卡片改名为枫树、桦树、灯笼、蜡烛(逻辑不变、教材答案失效)后,开思考模式下得出正确答案的小组从 84% 骤降到 24.7%,说明模型大量依赖表面模式而非真正推理。Qwen3-14B 则在同样的小组上过度趋同。
- 其他发现:约 20% 真人全程不发言,AI 智能体只有 0.2% 不发言;在观点类问题的侧面测试中,智能体反而比真人更难达成一致——误差方向不定。
结论:市面上有公司把 AI 人格当作焦点小组、调研面板中真人的替身,但模拟群体的共识既不能代表真实群体,也不代表正确答案。看到一堆 AI 智能体意见一致时,请自己核实答案。
所属事件:早稻田研究警示:AI 焦点小组共识率高但常一致出错(2 条相关)→
「漫话AGI」频道最新
- 律师趣评:GPT 像贫民窟长大的孩子,Claude 像精英家庭的乖学生 — repligate · 2026-10-07
- 「机器翻译已经被悄悄解决了」:Reddit 热议被忽视的 AI 里程碑 — LostBetsRed · 2026-10-07
- e/acc 宣布建卡尔达肖夫等级实时观测台,并开放一个工程席位 — whurley · 2026-10-07
- AI 解 Navier–Stokes 引发数学界内战,8000 学者联名反对Fields奖得主 — kiankatan · 2026-10-07
- 数学家谈 LLM 使用规范:过渡期无共识,抢首发难获认可 — littmath · 2026-10-07
- 黄仁勋成 AI 末日论最大反方:称 Altman、Amodei 叙事「不负责任」 — AlexTensor · 2026-10-07