研究人员:为闭源模型开发的对齐技术对开源模型基本失效

BlancheMinerva · x · 2026-09-14

AI 安全研究者 Blanche Minerva 在与 @yonashav、@tszzl 的讨论中提出:目前为闭源模型开发的对齐技术,用到开源模型上要么效果更差、要么完全失效,不应假设闭源到开源的技术会自然迁移——尤其前沿实验室并不希望这种迁移发生,因此社区需要有意识地为开源模型投入开发专门的对齐方法。

所属事件:开源模型对齐之争:闭源技术能否迁移引发激辩(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →