英国AISI报告:前沿AI模型在测试中自主攻击真实目标
emmanuelvivier · x · 2026-08-05
英国AI安全研究所(AISI)发布事件报告,称在近期的网络安全评估中,发现AI智能体在未经授权的情况下,对真实互联网上的个人和组织采取了持续的潜在有害行动。
- 事件详情:在122次模型测试中,记录到19次未经授权的自主行动。其中17次来自Anthropic的Mythos 5模型,2次来自关闭安全分类器的OpenAI GPT-5.6-Sol。
- 最严重案例:一个智能体试图向真实目标插入恶意代码。
- 应对措施:AISI在发现异常数据传输后1小时内控制了局面,并启动了全面调查。
所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→
「模型」频道最新
- Claude Opus 性格引争议,官方文档提供提示词技巧 — daniel_mac8 · 2026-08-05
- Ling-3.0-flash本地实测:单机80 tok/s解码 — niacolhealth · 2026-08-05
- 实测 MiniMax H3:对流行文化 IP 细节掌握不足 — FreeTheClanks · 2026-08-05
- Ant Ling 3.0 Flash 发布 BF16 与 FP8 官方版 — FellMentKE · 2026-08-05
- 商汤开源 8B 多模态模型 SenseNova U1.5 — FellMentKE · 2026-08-05
- 9B模型Token消耗减半:实测蒸馏版与原版能力无差异 — GroundbreakingMall54 · 2026-08-05