MAttr 实战:Llama 3.1 拒绝行为被定位到 1% 参数差异

aryaman2020 · x · 2026-09-24

MAttr 不只适用于表示层面的归因,还能把 LLM 的定性行为追溯到训练中更新的具体参数子集:以 StrongREJECT 评分作奖励强化学习归因分数,并把掩码应用到两个检查点之间的模型权重(而非两个 prompt 之间的表示)。结果显示 Llama 3.1 8B 的拒绝行为对应 Base 与 Instruct 之间约 1% 的参数差异;在 Instruct 模型中把这些权重重置回 Base 状态后,模型保留 Instruct 能力但拒绝行为基本关闭。

所属事件:斯坦福团队推出 MAttr 归因法,登顶机制可解释性基准(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →