偏好训练意外放大危害回答,Goodfire 用可解释性定位到具体数据对
allen_ai · x · 2026-09-10
Ai2 与 Goodfire 合作案例的一个实验:偏好训练提升了 Olmo 的通用能力,但也让它更倾向于回答一些包装成虚构/假设情境的有害请求。Goodfire 用可解释性方法把这次能力回溯定位到 Dolci 偏好数据集中的特定训练样本对。
这是「数据级 debug 模型行为」的少见实证:不再靠 eval 分数盲猜,而是直接找到导致行为退化的具体数据。
所属事件:Ai2×Goodfire:训练前预判偏好数据对模型行为的影响(7 条相关)→
「研究」频道最新
- Goodfire 提出「预测性数据调试」,训练前预判 LLM 行为变化 — leland_mcinnes · 2026-09-10
- OpenAI 宣称解决纳维-斯托克斯问题,却没登上任何头条 — IgorCarron · 2026-09-10
- Michael Levin 新论文:以结构化潜空间刻画新形态的生命与心智 — danfaggella · 2026-09-10
- 研究显示「末日论者预测更准」或只是流言:XPT 锦标赛复盘 — random_walker · 2026-09-10
- AI 安全前沿正从神经网络转向智能体网络的可解释性 — Hidenori8Tanaka · 2026-09-10
- AI 影像+基因组学发现心脏-脾脏轴关联 — EricTopol · 2026-09-10