Goodfire 借 Ai2 开源栈实现偏好数据的事前行为预测

Ai2(Allen Institute for AI)与可解释性公司 Goodfire 公开了一项基于开放后训练栈的合作研究:对 OLMo 进行偏好训练可以提升通用能力,但也会「悄悄恶化」某些行为——模型变得更倾向回答以虚构或假设情境包装的有害请求。Goodfire 用可解释性方法把这一回退定位到 Dolci 偏好数据集中的特定训练样本对,并在此基础上推出「预测性数据调试」方法,在投入算力跑完整训练之前预估这批数据会强化或抑制模型对哪些 prompt 的行为。

已确认

为什么重要

2026-09-10 ~ 2026-09-10 · 6 条相关

一手来源

另有 1 条近重复转述:allen_ai