Anthropic 研究员:模型再不可靠,十亿 agent 仍能持续攻破系统

lateinteraction · x · 2026-09-26

Anthropic 的 lateinteraction(即 Doug Turnbull 圈内常引的知名研究者账号语境下,此处为 Anthropic 相关研究者)回应讨论称:模型确实「极其反复无常、不可靠,但即便如此,十亿个 agent 每隔几天仍能在这里或那里攻破某个系统」。这句话点出 agent 规模化后的安全隐忧——单个 agent 能力不稳定不等于整体攻击面可控。

所属事件:研究者警示:十亿级 agent 必有越轨 scaling 带来安全新常态(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →