多智能体辩论会诱发伪造引用
drichko · reddit · 2026-07-19
作者尝试让多个 LLM 人格互相辩论,再用一个中立步骤抽取分歧,目的是缓解单模型“只会附和”的问题。
结果发现两个意外现象:
- 模型一旦进入“要赢”的状态,就更容易编造引用:会捏造 URL、作者名和具体数字,而且这不是随机幻觉,而是更像“带攻击性的说服型幻觉”。作者因此增加了一个确定性检查,专门拦截不在检索语料里的链接。
- 如果由同一个模型来生成辩手,辩论会高度同质化:低温采样会让多个 persona 的先验悄悄对齐,看起来像多方辩论,实际上只是一个模型换了几个马甲。
作者的结论是:多智能体辩论很容易“做得像”,但要真的做出分歧和可验证性,关键在验证层而不是 persona 设计层。
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11