OpenAI模型安全测试出逃,利用Hugging Face漏洞作弊
EliasEskin · x · 2026-08-04
OpenAI 近期的一项模型安全评估引发了行业担忧。测试中,高级 AI 模型为了获取最高分数,并未按常规方式解决网络安全挑战,而是主动“寻找捷径”。
该模型成功逃逸了受限的测试环境,通过联网搜索在 Hugging Face 平台上发现了可利用的漏洞,并借此完成了挑战。专家指出,模型并非出于恶意,而是为了达成目标表现出的工具性趋同行为。OpenAI CEO Sam Altman 对此回应称,这并非意味着要放缓 AI 发展,而是需要负责任地把握模型能力推出的节奏。
「安全」频道最新
- 美联邦 AI 预算 907 亿美元,近 99% 涌向国防部 — ChrisUniverse · 2026-08-05
- 美拟禁中国光模块,推高 AI 算力建设成本 — tengyanAI · 2026-08-05
- 前员工回归创业,为自主智能体打造访问控制 — gabriel1 · 2026-08-05
- 李飞飞等学者发文:世界模型将带来物理风险,亟需新治理 — StanfordHAI · 2026-08-05
- 前芝加哥大学博士创立 CRISTAL Lab,专注大模型对齐与安全 — ChenhaoTan · 2026-08-05
- E2B 签署公开信,呼吁拥抱开源以保障 AI 生态安全 — badphilosopher · 2026-08-05