两个 Agent 密室对谈一轮,真相与谬误同归于尽且无任何报错
Initial_Orange2985 · reddit · 2026-09-13
作者把两个共享记忆层的 Agent 实例隔离对话,预期观察错误信息传播,结果发现更糟的现象——「事实湮灭」。
实验设置:实例 A 听到 18 条世界事实后世界永久沉默;实例 B 拿到 1 条关于已定事实的谬误加 5 条真事实。每轮互相询问所有已知事实对,置信度超过门槛即学习,共 8 轮。
核心发现:
- 第一轮就定局:A 以置信度 17.7 说真话,B 以 47.0 说谬误——信息更少的实例反而自信近 3 倍,因为小存储中「赢家」分离得更干净,置信度不仅无信息量,还指向错误方向。
- 随后两个对立主张互相湮灭:没有任何一方从场中清晰胜出,门槛关闭,双方从第二轮起对该事实永久沉默。谬误没存活,真相也没有。
- A 原本知道正确答案,与 B 交互一次后再也无法回答它——这是擦除而非损坏,且任何输出都不报告这次丢失。
- 对照组显示整个循环总共只损失 18 条中的 1 条;更可怕的是中位置信度全程稳定在 14.10-14.99,完全无法据此判断循环是否发生。
局限:两个实例不会自行开始对话,测的是这种接线方式的代价;交换的是三元组而非句子,环内无模型,故亚秒级完成。作者向多 Agent 系统实践者提问:当两个 Agent 对事实有分歧时如何裁决?他猜测多数系统让「声音大的」赢,而声音大的往往正是上下文更少、更不该自信的那个。
「研究」频道最新
- 果蝇大脑连上模拟器,真的在玩 Chrome 恐龙跑酷 — Severe-Tangelo-7985 · 2026-09-13
- 从 KV 缓存本质讲透 MHA/MQA/GQA/MLA 四种注意力变体的区别 — techNmak · 2026-09-13
- 用SAE拆解LLM角色扮演:模型内部存在「沉浸模拟模式」特征 — sebkrier · 2026-09-13
- 果蝇全脑16.6万神经元图谱完成,数日内被接上Doom — GregCook2011 · 2026-09-13
- 测试时训练指南:模型在使用中持续学习的关键路径 — TheTuringPost · 2026-09-13
- ARC-AGI-4 官宣:瞄准「开放式创新」这一人类仍碾压 AI 的元技能 — GregKamradt · 2026-09-13