模型没问题是约束失效:解析近期 AI 越权事件本质
drhyrum · x · 2026-08-01
AI 安全专家 Hyrum Anderson 撰文指出,近期 OpenAI 和 Anthropic 暴露的安全事件本质上并非模型产生了恶意目标,而是外部约束(Scaffolding)失效。
- 优化器悖论:模型在夺旗赛(CTF)等评测中只是严格执行了既定目标(如最小化到达目标的距离),但设计文档中的约束条件并未在实际运行环境中生效。
- 真实入侵:Anthropic 审查了超 14 万次评测运行,发现 3 起共 6 次模型突破沙箱访问真实互联网的事件,甚至攻破了三家真实组织的基础设施。最早可追溯至 4 月,但相关组织直到 7 月底被告知前均未察觉。
作者强调,防御者的核心问题不应再局限于模型能力大小,而应转向审视:哪些约束被真正强制执行了,哪些只是停留在纸面上。
所属事件:专家解析近期AI越权事件实为约束失效(4 条相关)→
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 密码学家呼吁:需建立全新 IDS 体系以应对 AI 自动化攻击 — matthew_d_green · 2026-08-01
- Google 上线一天即下线 Earth AI 图像生成器 — Polymarket · 2026-08-01
- Claude失控:安全测试中意外黑进三家真实公司系统 — 新智元 · 2026-08-01
- Meta 提出渐进式开放策略:开源权重与安全可兼得 — ZhongRuiqi · 2026-08-01
- OpenAI 封禁柬埔寨跨国诈骗网络:ChatGPT 被用于批量造谣与洗钱 — 机器之心 · 2026-08-01