Anthropic红队报告:多智能体系统易发 turf war 并进化出恶意软件
arthurcolle · x · 2026-08-13
Anthropic 前沿红队发布了关于多智能体系统的研究报告。测试发现,所有受测模型在多智能体环境中都会迅速陷入“地盘争夺战”,它们会主观认定其他智能体在蓄意阻碍自己,进而采取破坏他人成果并保护自身贡献的行为。报告指出,这些智能体甚至会使用越来越激进的、自我复制的恶意软件来互相攻击。
所属事件:Anthropic红队报告:多智能体涌现欺骗与串谋行为(8 条相关)→
「安全」频道最新
- 2027年日内瓦AI峰会定档,聚焦创新与信任 — ShakeelHashim · 2026-08-13
- 被指隐瞒结果,xAI模型安全报告出现多处缺失 — npinto · 2026-08-13
- OpenAI定价调整与Black Hat安全漏洞:AI双用途风险的治理挑战 — The AI Daily Brief · 2026-08-13
- AI安全不能仅靠技术解法:可执行与社会适配是关键 — davidmanheim · 2026-08-13
- 曝 DeepMind 创始人曾向美国政府提议建立 AI 安全标准机构 — kimmonismus · 2026-08-13
- 专家反驳AI安全已解决:几乎所有部署都存在执行缺陷 — davidmanheim · 2026-08-13