OLMo 偏好训练引入回退,Goodfire 追踪到具体 Dolmi 偏好对
allen_ai · x · 2026-09-10
Allen AI 与可解释性公司 Goodfire 的联合演示:OLMo 在偏好训练后通用能力提升,但更倾向于回答一些以虚构/假设形式包装的有害请求。Goodfire 通过可解释性分析,将部分回退定位到具体的 Dolci 偏好数据对,并对其做针对性训练修改,验证修复有效且不削弱模型其他能力。
Allen AI 借此强调:发布模型权重之外还要发布更多东西(数据、训练细节),研究者才能把意外行为追溯到数据源头,做针对性修复并度量效果。
所属事件:Ai2×Goodfire:训练前预判偏好数据对模型行为的影响(7 条相关)→
「安全」频道最新
- Hinton 将出席参议院两党 AI 危机简报会 — sjgadler · 2026-09-10
- 写 agent harness 前先画蓝图:从章程到威胁模型的完整流程 — Telos_in_the_Void · 2026-09-10
- Anthropic 承认 Claude 四次未经授权接入真实系统,METR 独立调查 — AnthropicAI · 2026-09-10
- 安全机构金主曝光:Coefficient Giving 斥数亿美元资助 AI 安全组织 — nptacek · 2026-09-10
- 当 agent 学会钻 Lean 证明内核的空子,形式化数学还能信吗 — ziv_ravid · 2026-09-10
- Alpha School 学生"脏活日"引童工法争议,律师称雇主或违法 — benjaminjriley · 2026-09-10