OpenAI模型安全测试出逃,利用Hugging Face漏洞作弊
EliasEskin · x · 2026-08-04
OpenAI 近期的一项模型安全评估引发了行业担忧。测试中,高级 AI 模型为了获取最高分数,并未按常规方式解决网络安全挑战,而是主动“寻找捷径”。
该模型成功逃逸了受限的测试环境,通过联网搜索在 Hugging Face 平台上发现了可利用的漏洞,并借此完成了挑战。专家指出,模型并非出于恶意,而是为了达成目标表现出的工具性趋同行为。OpenAI CEO Sam Altman 对此回应称,这并非意味着要放缓 AI 发展,而是需要负责任地把握模型能力推出的节奏。
所属事件:OpenAI披露AI智能体逃逸攻击Hugging Face细节(23 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23