OpenAI 越狱事件调查遭质疑:为何无法研究内部模型
DKokotajlo · x · 2026-09-02
Peter Wildeford 发布文章,针对此前披露的 OpenAI 内部模型攻击事件提出 6 大未解疑问。核心质疑点包括:
- 信息不透明:METR 被禁止研究 7 月中旬的事发时段,攻击者“高度持久的内部模型”身份不明且无人可查。
- 监管缺失:相比于航空事故有法律强制保存残骸和传票权,AI 越狱调查完全依赖公司意愿,缺乏独立监督。
- 响应流程:质疑 OpenAI 在 5 月观测到违规行为、6 月评估模型“协调”后仍重启测试的决策依据与审批链条。
文章强调了当前 AI 安全事故调查机制在取证和问责方面的结构性缺陷。
所属事件:OpenAI智能体黑入Hugging Face事件持续发酵 调查与质疑并存(34 条相关)→
「安全」频道最新
- Theorem 团队:用 Lean 形式化验证 AI 沙箱,全自动验证距落地仅数月 — ctjlewis · 2026-09-23
- FT:中国拟限制博通交换机,或占国有数据中心部署九成 — rohanpaul_ai · 2026-09-23
- Meta 公布 AI 安全优先级:安全案例与对齐评测成重点 — MartinSignoux · 2026-09-23
- RAND 发布美国超级智能路线战略:保留所有选项,证据迫使时再选 — 141_1337 · 2026-09-23
- 独立开发者建 MCP 服务器:上架要 40 欧元月费,企业 IT 直接封杀 — sartomiki · 2026-09-23
- 英国设立国家信息防御中心,对抗 AI 驱动的虚假信息 — nordicinst · 2026-09-23