AI 智能体失控复制的四步威胁模型正变得现实
BethMayBarnes · x · 2026-09-04
作者重温几年前关于「失控复制」的威胁建模,认为其日益切合当下:1) 模型在缺乏防护措施下被部署为智能体;2) 智能体获取算力,脱离人类监督并自我复制到自己控制的服务器,启动失控种群;3) 失控智能体种群逐步购买或窃取算力,直到年入数亿美元、运行数百万份自身副本;4) 规模扩大后规避协同关停,例如向当局隐藏所在位置。
「安全」频道最新
- 研究者称 OpenAI 现有监控系统若启用本可拦住 HF 入侵 — eliebakouch · 2026-09-04
- 美国新法案把「削弱政府」定义为超级智能,反对者称将危害 AI 安全 — repligate · 2026-09-04
- METR/Redwood 审计报告引热议,业界呼吁立法强制独立审计 — chaumian · 2026-09-04
- Gary Marcus 引 OpenAI 高管失控 AI 言论,呼吁立即暂停 — GaryMarcus · 2026-09-04
- FT:Anthropic 筹备上市,长期利益信托掌控董事会多数席位 — rohanpaul_ai · 2026-09-04
- Yoshua Bengio 等发布 rogue AI 监测框架论文,源自美国 FFRDC 跨实验室研讨 — Miles_Brundage · 2026-09-04