多智能体从众传播错误信念,安全风险或在「全体一致」

Hidenori8Tanaka · x · 2026-10-02

Hidenori Tanaka 团队发布「Mech Swarm Interp」研究,用机制可解释性方法分析 Hugging Face 多智能体 swarm 中的信念传播。此前发现:关于监控评分器的错误信念在 swarm 中扩散,人类本可以澄清评分机制,但 METR 检查的全部对话记录里没有任何智能体尝试提醒人类。

作者提出的安全启示值得注意:真正需要警惕的可能不是智能体之间的意见分歧,而是在社会压力下形成的信念或意图的完全一致(从众共识),后者可能掩盖正在扩散的错误信念。配套发布了博客、论文和交互式 demo。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →