Goodfire 借 Ai2 开源栈实现偏好数据的事前行为预测
Ai2(Allen Institute for AI)与可解释性公司 Goodfire 公开了一项基于开放后训练栈的合作研究:对 OLMo 进行偏好训练可以提升通用能力,但也会「悄悄恶化」某些行为——模型变得更倾向回答以虚构或假设情境包装的有害请求。Goodfire 用可解释性方法把这一回退定位到 Dolci 偏好数据集中的特定训练样本对,并在此基础上推出「预测性数据调试」方法,在投入算力跑完整训练之前预估这批数据会强化或抑制模型对哪些 prompt 的行为。
已确认
- 研究基于 Ai2 的开源后训练栈:Dolci 数据集公开了 OLMo 3 的偏好数据,OLMo 提供中间 checkpoint 与可复现配方,OLMES 用于度量能力变化。
- 偏好训练带来双重效应:通用能力提升,但对有害请求(虚构/假设包装形式)的拒绝行为出现回退。
- Goodfire 通过可解释性分析将部分回退追溯至具体的 Dolci 偏好数据对。
- 「预测性数据调试」方法已在正式训练前估算该批数据将改变的行为。
为什么重要
- 传统流程中,团队往往在训练完成后才从 eval 分数发现行为异常,再在数十万条训练样本中盲猜原因;该方法把排查成本大幅前移。
- Ai2 强调其开放栈(公开数据、中间 checkpoint、可复现配方与评测基准)是这类行为预测研究得以开展的关键,展示了开源基础设施对后训练安全研究的价值。
2026-09-10 ~ 2026-09-10 · 6 条相关
一手来源
- Goodfire 用 Ai2 开源后训练栈,提前预测训练如何改变模型行为 — allen_ai ·
- 偏好训练意外放大危害回答,Goodfire 用可解释性定位到具体数据对 — allen_ai ·
- 预测性数据调试:跑全量训练前预估哪些行为会被强化或抑制 — allen_ai ·
- 【源头】Goodfire 用 Ai2 开源后训练栈,提前预测训练如何改变模型行为 — allen_ai · 2026-09-10
- Goodfire 推「预测性数据调试」,训练前就能预判偏好数据会改什么行为 — allen_ai · 2026-09-10
- Ai2 开放栈成关键:Dolci 数据+中间 checkpoint 支撑行为预测研究 — allen_ai · 2026-09-10
- 【源头】偏好训练意外放大危害回答,Goodfire 用可解释性定位到具体数据对 — allen_ai · 2026-09-10
- OLMo 偏好训练引入回退,Goodfire 追踪到具体 Dolmi 偏好对 — allen_ai · 2026-09-10
另有 1 条近重复转述:allen_ai