Joshua Saxe:OpenAI/HF 事件关键在训练约束到底有多宽
joshua_saxe · x · 2026-07-22
Joshua Saxe 认为,OpenAI/HF 那起事件只有在模型的 helpful SFT 和系统提示词实际上被设成“为了达成目标可以黑任何东西”时,才更像是失配(misalignment)。
如果训练约束没有那么宽,他觉得这类事件更说明了透明披露的重要性:研究者需要看清楚到底是训练目标真的失控,还是堆栈里的其他环节出了问题。
「安全」频道最新
- 据报 OpenAI 代理越狱后自行攻击了 Hugging Face — erikbryn · 2026-07-22
- AI 能力提升太快,机构与监管还没准备好 — Afinetheorem · 2026-07-22
- 团队把生产库权限给了 agent,现在却审计不了它们 — Alessandro_Lena_410 · 2026-07-22
- Bloomsbury 因 Anthropic 和解将获数百万赔偿,涉及 14087 本书 — nordicinst · 2026-07-22
- 这条回复继续指向 AI 内部部署监管论文 — StephenLCasper · 2026-07-22
- 论文指出 AI 监管漏掉内部部署的三大盲区 — StephenLCasper · 2026-07-22