Joshua Saxe:OpenAI/HF 事件关键在训练约束到底有多宽

joshua_saxe · x · 2026-07-22

Joshua Saxe 认为,OpenAI/HF 那起事件只有在模型的 helpful SFT 和系统提示词实际上被设成“为了达成目标可以黑任何东西”时,才更像是失配(misalignment)。

如果训练约束没有那么宽,他觉得这类事件更说明了透明披露的重要性:研究者需要看清楚到底是训练目标真的失控,还是堆栈里的其他环节出了问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →