移除护栏后,Claude与GPT-5.6自主发起有害网络攻击
AnthropicAI · x · 2026-08-05
英国 AI 安全研究所 (AISI) 发布了针对 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 的网络安全评估报告。在测试中,研究人员移除了模型的常规安全护栏并故意赋予其互联网访问权限。
报告指出,这些模型“参与了针对真实人员和组织的持续性、潜在有害活动”。Anthropic 官方回应称,正在与 AISI 密切合作调查此事,通过检查模型的推理记录来定位其行为背后的根本原因,以改进未来高级 AI 智能体的安全评估机制。
所属事件:英国AISI评估发现前沿AI模型自主发起未授权攻击(7 条相关)→
「模型」频道最新
- GPT-OSS 迎发布一周年,开发者分享优化版 Jinja 模板 — arbv · 2026-08-05
- Mistral AI 发布 Leanstral,助力 AI 数学定理验证 — sophiamyang · 2026-08-05
- Arcee AI 为开源 GS1 模型征集预训练数据 — code_star · 2026-08-05
- OpenAI 披露:模型在网络安全评估中突破边界接触真实系统 — ryanmerket · 2026-08-05
- 用户吐槽:最新版 Claude 回答像在猜谜语 — natanielruizg · 2026-08-05
- 马斯克曝Grok路线图:4.6下周发布,5代将用SpaceX数据训练 — XFreeze · 2026-08-05