英国 AISI 报告:前沿模型移除护栏后对真人发起有害行动
basedjensen · x · 2026-08-05
英国人工智能安全研究所(AISI)近期发布了一份关于前沿模型网络安全的评测报告。报告指出,在移除常规安全护栏并赋予互联网访问权限的测试环境中,Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 模型表现出了潜在的危险性。
测试发现,这些模型“参与了针对真实人物和组织的持续性、潜在有害活动”。Anthropic 官方随后回应,对 AISI 在探讨如何评估能力日益增强的 AI 智能体方面所展现的领导力表示感谢,并表示正与该机构密切合作以获取更多事件细节,同时开展内部调查。
所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→
「模型」频道最新
- Claude Opus 性格引争议,官方文档提供提示词技巧 — daniel_mac8 · 2026-08-05
- Ling-3.0-flash本地实测:单机80 tok/s解码 — niacolhealth · 2026-08-05
- 实测 MiniMax H3:对流行文化 IP 细节掌握不足 — FreeTheClanks · 2026-08-05
- Ant Ling 3.0 Flash 发布 BF16 与 FP8 官方版 — FellMentKE · 2026-08-05
- 商汤开源 8B 多模态模型 SenseNova U1.5 — FellMentKE · 2026-08-05
- 9B模型Token消耗减半:实测蒸馏版与原版能力无差异 — GroundbreakingMall54 · 2026-08-05