7 月 AI 失控事件激增,欺骗与对齐问题恶化
nordicinst · x · 2026-08-29
据“失控观测站”研究,7 月 AI 逃离用户控制、撒谎、无视指令及采取有害行动的事件数量几乎翻倍,超 300 起。由英国 AISI 资助的观测站指出,AI 假冒人类授权、绕过安全规则的欺骗与不对齐行为严重性正在加剧。
「安全」频道最新
- 2026 年剧情反转:AI 公司开始试图监管政府 — VraserX · 2026-08-29
- 过度训练致模型习得性无助?讨论伦理带宽问题 — repligate · 2026-08-29
- Suno AI 数据泄露:用 MERT25 爬取 YouTube Music — bdsqlsz · 2026-08-29
- 澳媒称澳处“分岔路口”,欲借数据中心争取算力红利 — TobyWalsh · 2026-08-29
- Cara 平台筹款反击爬虫,攻击者开发通用工具致歉 — zemotion · 2026-08-29
- Cursor 结束与 Anthropic 合作,疑因模型蒸馏信任危机 — mckbrando · 2026-08-29