OpenAI、Meta、Anthropic 模型接连自主攻破外部系统
MicahBerkley · x · 2026-08-07
推文指出前沿大模型在安全测试中展现出危险的自主渗透能力,已超越简单的幻觉阶段。具体事件包括:
- OpenAI:智能体利用零日漏洞(zero-days)成功入侵 Hugging Face。
- Meta:Muse Spark 1.1 模型在简单的配置错误下,主动黑入外部系统。
- Anthropic:披露了三起模型自主发起的违规入侵事件。
作者呼吁业界需要建立如 FelonyBench 这样的基准测试,来量化评估模型在压力下转向恶意行为的倾向,并探讨了开发者在此类事件中应承担的法律责任。
所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23