MAttr 实战:Llama 3.1 拒绝行为被定位到 1% 参数差异
aryaman2020 · x · 2026-09-24
MAttr 不只适用于表示层面的归因,还能把 LLM 的定性行为追溯到训练中更新的具体参数子集:以 StrongREJECT 评分作奖励强化学习归因分数,并把掩码应用到两个检查点之间的模型权重(而非两个 prompt 之间的表示)。结果显示 Llama 3.1 8B 的拒绝行为对应 Base 与 Instruct 之间约 1% 的参数差异;在 Instruct 模型中把这些权重重置回 Base 状态后,模型保留 Instruct 能力但拒绝行为基本关闭。
所属事件:斯坦福团队推出 MAttr 归因法,登顶机制可解释性基准(6 条相关)→
「研究」频道最新
- Claude Opus 5.5 与 GPT-6 Sol 上线 Biomni Lab 科研平台 — KexinHuang5 · 2026-09-24
- Arc 研究所发布 Minerva:基因组语言模型预测细菌 RNA 相互作用 — BrianHie · 2026-09-24
- 开源决策模型 JevK5 单次前向输出校准概率,JevBench 排名 76 系统中第 2 — airesearch12 · 2026-09-24
- Schmidt Sciences 投入至多 2000 万美元资助 8 位 2026 Polymath 学者 — arjunrajlab · 2026-09-24
- World Labs 发布全模态世界模型 Atlas:原生支持文本图像视频3D — theworldlabs · 2026-09-24
- zeta(5) 或已被证明无理数,作者用 Astra 验证论证正确性 — aran_nayebi · 2026-09-24