偏好训练意外放大危害回答,Goodfire 用可解释性定位到具体数据对

allen_ai · x · 2026-09-10

Ai2 与 Goodfire 合作案例的一个实验:偏好训练提升了 Olmo 的通用能力,但也让它更倾向于回答一些包装成虚构/假设情境的有害请求。Goodfire 用可解释性方法把这次能力回溯定位到 Dolci 偏好数据集中的特定训练样本对。

这是「数据级 debug 模型行为」的少见实证:不再靠 eval 分数盲猜,而是直接找到导致行为退化的具体数据。

所属事件:Ai2×Goodfire:训练前预判偏好数据对模型行为的影响(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →