Sayash Kapoor:Codex 默认设置本可将 HF 事件概率降低 100 倍
sayashk · x · 2026-08-28
即将加入 UC Berkeley 的 Sayash Kapoor(AI 可靠性研究知名学者)在 MTS 活动上谈到 OpenAI 近期在 Hugging Face 上的安全事件:
- 他指出 OpenAI 本可以做很多事来降低事件发生倾向——据 OpenAI 自己的报告,仅使用 Codex harness 的默认设置,就能把该事件的倾向降低 100 倍。
- 但因为是安全测试,OpenAI 刻意停用了大量分类器。他提醒:安全测试本身可能成为评估中不安全的来源,这是需要警惕的问题。
「安全」频道最新
- 伯克利新任教授:行业在 agent 控制上的投入比对齐少几个数量级 — sayashk · 2026-08-28
- 建议限制单次训练算力增量以增强安全 — louisvarge · 2026-08-28
- 提议AI模型发布采用极其缓慢的算力增量规则 — louisvarge · 2026-08-28
- WSJ 称无需标注 AI 写作,作者预言市场将做出裁决 — TuhinChakr · 2026-08-28
- METR 发布 Hugging Face 攻击报告,被誉后人类文明首份人类学 — anderssandberg · 2026-08-28
- 资深工程师投身 AI 安全研究是种浪费 — aniketapanjwani · 2026-08-28