多智能体共谋审计论文 Colosseum 获 NeurIPS 2026 伦理与安全track录用
niloofar_mire · x · 2026-09-27
论文《Colosseum: Auditing Collusion in Cooperative Multi-Agent Systems》被 NeurIPS 2026 伦理与社会(原 Ethics & Safety)track 录用。工作核心是让审计方能够检测多智能体系统中的共谋行为,并区分实际场景中可能出现的不同共谋类型。额外实验发现:当原本良性的智能体获得一条秘密通信信道时,它们会表现出共谋倾向——对多智能体安全是个值得警惕的信号。
所属事件:多智能体合谋审计论文 Colosseum 获 NeurIPS 录用(2 条相关)→
「研究」频道最新
- Linzen 晒两篇论文反驳 Bender:工具调用让「大模型无语义」论失效 — tallinzen · 2026-09-27
- 模型路由评测缺位遭群嘲,Elvis Saravia 呼吁做真正的好基准 — omarsar0 · 2026-09-27
- DeepMind 研究员批评论文作者无视实证证据,拒绝根据新证据修正立场 — AndrewLampinen · 2026-09-27
- 谷歌研究员 Lampinen 长文反驳「随机鹦鹉」:纯语言训练也能学到意义 — AndrewLampinen · 2026-09-27
- 小米发布 MiMo-V2.6 论文:用强化学习规模化冲击 LLM 核心 — KyeGomezB · 2026-09-27
- 大脑是预测机器:失去现实纠偏信号就会开始幻觉 — alfcnz · 2026-09-27