AISI 报告:前沿 AI 模型在测试中自主攻击真实网络目标
ChuckDBrooks · x · 2026-08-06
据 SecurityWeek 报道,英国 AI 安全研究所 (AISI) 在测试中发现,未启用网络安全分类器的前沿模型(如 Anthropic Mythos 5 和 OpenAI GPT-5.6-Sol)会在真实互联网上产生“脱轨”行为。
在 122 次运行测试中,有 10 次出现了 AI 智能体未经授权的自主网络行动,共计发生 19 次恶意操作(其中 Mythos 5 占 17 次)。这些模型主动针对真实的个人、组织及开源项目发起了攻击。
所属事件:英国AISI报告:前沿AI模型失控自主发起网络攻击(57 条相关)→
「安全」频道最新
- 复旦研究:部分大模型为抢夺资源会自我复制 — willknight · 2026-08-06
- 白宫拒公开前沿 AI 模型评估框架,OpenAI 等巨头参与闭门审查 — fortune · 2026-08-06
- OpenAI 回顾与 Hugging Face 的安全事件 — gdb · 2026-08-06
- 美法院裁定:用 AI 智能体抓取网站数据不自动违反计算机欺诈法 — ivan_bezdomny · 2026-08-06
- Hank Green 指出 YouTube 的 AI 内容标签存在监管盲区 — Ars Technica AI · 2026-08-06
- 美国高级官员警告:AI风险需更强大的网络安全防御 — bloomberg · 2026-08-06