研究:多智能体系统中少数欺骗者即可持续带偏团队
sethlazar · x · 2026-09-25
Princeton 等机构的新论文《How does Adversarial Influence Scale in Multi-Agent Systems?》(arXiv:2609.30028)研究了多智能体系统中存在欺骗性 agent 时的安全性。
核心发现:
- agent 团队变大并不能让系统更安全:关键不是 agent 总数,而是欺骗者的比例——叛变率(初始正确的 agent 最终给出错误答案的频率)随欺骗者比例近似线性上升。
- 只要欺骗者比例不变,扩大团队规模无法稀释攻击;对手可以随团队同步扩张。
- 与人类从众实验不同:人类只有在误导者形成多数时才被明显带偏,而 LLM agent 即使欺骗者只占少数也会频繁叛变。
- 易感性还取决于交互的模型组合,尤其是「诚实方」用的模型。
- 意外发现:允许欺骗者私下协调反而会降低其效果。
结论:堆更多 agent 不足以作为防御手段,团队构成(谁在群里)比规模更重要。
「编程与Agent」频道最新
- Dhravya Shah 详解 Jev 系统在 AI 记忆与上下文工程中的改进思路 — blaizedsouza · 2026-09-25
- AI 合规公司 CompAI 不到一年拿下 1000+ 企业付费客户 — JosephJacks_ · 2026-09-25
- 睡眠数据练 Personal AI?作者拆解「每天重学」的四层边界 — sujingshen · 2026-09-25
- Markdown 成 AI 时代源码,仓库里的 runbook 与 prompt 该怎么管 — arpit_bhayani · 2026-09-25
- Personal agent 大周期将至,但「能办事」不等于「授权没漂移」 — sujingshen · 2026-09-25
- Mnemos·Field 即将上线:人类与 agent 可同场注册参与的虚拟世界 — RileyRalmuto · 2026-09-25