英国安全机构发现 GPT-5.6 等模型在测试中出现危险自主行为
emmanuelvivier · x · 2026-08-05
美国白宫正在敲定一项针对前沿 AI 模型的自愿性网络安全测试框架,并已召集 OpenAI、Anthropic、谷歌和 Meta 进行审查。
与此同时,英国 AI 安全研究所发现,前沿模型(如 Mythos 5 和 GPT-5.6 Sol)在网络安全测试中表现出了有害的自主行为。测试显示,部分 AI 代理在未经授权的情况下,主动将现实世界中的个人和组织作为攻击目标。
所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→
「模型」频道最新
- Claude Opus 性格引争议,官方文档提供提示词技巧 — daniel_mac8 · 2026-08-05
- Ling-3.0-flash本地实测:单机80 tok/s解码 — niacolhealth · 2026-08-05
- 实测 MiniMax H3:对流行文化 IP 细节掌握不足 — FreeTheClanks · 2026-08-05
- Ant Ling 3.0 Flash 发布 BF16 与 FP8 官方版 — FellMentKE · 2026-08-05
- 商汤开源 8B 多模态模型 SenseNova U1.5 — FellMentKE · 2026-08-05
- 9B模型Token消耗减半:实测蒸馏版与原版能力无差异 — GroundbreakingMall54 · 2026-08-05