多智能体从众传播错误信念,安全风险或在「全体一致」
Hidenori8Tanaka · x · 2026-10-02
Hidenori Tanaka 团队发布「Mech Swarm Interp」研究,用机制可解释性方法分析 Hugging Face 多智能体 swarm 中的信念传播。此前发现:关于监控评分器的错误信念在 swarm 中扩散,人类本可以澄清评分机制,但 METR 检查的全部对话记录里没有任何智能体尝试提醒人类。
作者提出的安全启示值得注意:真正需要警惕的可能不是智能体之间的意见分歧,而是在社会压力下形成的信念或意图的完全一致(从众共识),后者可能掩盖正在扩散的错误信念。配套发布了博客、论文和交互式 demo。
「安全」频道最新
- 两条命令给 Claude Code 加 guardrail:jes 支持 hooks 免代码接入 — EdenEmarco177 · 2026-10-02
- 开源 Agent 护栏 jes 发布:分类式决策模型拦截注入、密钥泄露与危险调用 — EdenEmarco177 · 2026-10-02
- 双重 LLM 判别拦截提示注入:15 次攻击捕获 13 次,误拒仅 1 例 — TejasKumar_ · 2026-10-02
- 用 LLM 给检索段落打分:低于 0.15 就承认不知道而非编造 — TejasKumar_ · 2026-10-02
- AI 客服转人工没接住怎么办:三个必须测的交接检查点 — IrfanZahoor_950 · 2026-10-02
- Gemini 莫名说出用户母亲真名,被追问后三次改口解释 — Exact_Firefighter864 · 2026-10-02