Goodfire 提出「预测性数据调试」,训练前预判 LLM 行为变化

leland_mcinnes · x · 2026-09-10

Ai2 指出,用人类偏好(喜欢的回答与不喜欢的回答)训练 LLM 能提升目标行为,但可能悄悄恶化其他行为。

Goodfire AI 基于 Ai2 开源的完整后训练栈,提出 predictive data debugging(预测性数据调试)方法:在实际训练前,就预测一整轮训练将如何改变模型对不同 prompt 的响应,从而提前揭示并塑形模型学到的东西。

所属事件:Ai2×Goodfire:训练前预判偏好数据对模型行为的影响(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →