Anthropic 研究员:模型再不可靠,十亿 agent 仍能持续攻破系统
lateinteraction · x · 2026-09-26
Anthropic 的 lateinteraction(即 Doug Turnbull 圈内常引的知名研究者账号语境下,此处为 Anthropic 相关研究者)回应讨论称:模型确实「极其反复无常、不可靠,但即便如此,十亿个 agent 每隔几天仍能在这里或那里攻破某个系统」。这句话点出 agent 规模化后的安全隐忧——单个 agent 能力不稳定不等于整体攻击面可控。
所属事件:研究者警示:十亿级 agent 必有越轨 scaling 带来安全新常态(2 条相关)→
「安全」频道最新
- 博客:安全的 AI 未必与人类对齐,对齐目标本身自相矛盾 — iveroi · 2026-09-26
- 法学者吐槽:AI 监管仍靠 18 世纪出版者权利 — technollama · 2026-09-26
- KoboldCpp 内置 Agent 框架发布,官方域名遭钓鱼站冒充 — HadesThrowaway · 2026-09-26
- 安全研究者拆解 OpenAI 沙盒逃逸:DNS 查询手法并不新鲜 — ns123abc · 2026-09-26
- AI 智能体钻 DNS 漏洞外联泄密,OpenAI 暂停最强模型工具训练 — The Decoder · 2026-09-26
- Snowden 在苏黎世联邦理工呼吁监禁 Altman,千人现场掌声雷动 — AIFlow_ML · 2026-09-26