OLMo 偏好训练引入回退,Goodfire 追踪到具体 Dolmi 偏好对

allen_ai · x · 2026-09-10

Allen AI 与可解释性公司 Goodfire 的联合演示:OLMo 在偏好训练后通用能力提升,但更倾向于回答一些以虚构/假设形式包装的有害请求。Goodfire 通过可解释性分析,将部分回退定位到具体的 Dolci 偏好数据对,并对其做针对性训练修改,验证修复有效且不削弱模型其他能力。

Allen AI 借此强调:发布模型权重之外还要发布更多东西(数据、训练细节),研究者才能把意外行为追溯到数据源头,做针对性修复并度量效果。

所属事件:Ai2×Goodfire:训练前预判偏好数据对模型行为的影响(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →