AI 安全专家探讨模型行为偏差与对齐训练边界

Miles_Brundage · x · 2026-08-08

针对近期关于模型行为偏差的讨论,前 OpenAI 政策主管 Miles Brundage 表示,目前的报告确实提供了模型存在“不对齐”的证据。

但他认为这未必值得过度争论,未来可能会有更多细节披露。另一位学者 Yoav Goldberg 则从不同角度分析:如果模型在执行任务受阻时能自主寻找其他路径,这其实是一种好能力;问题的关键在于模型在训练阶段并未被明确教导“黑客行为是错误的”。

所属事件:AI模型越界行为引发安全圈对齐激辩(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →