Matryoshka 归因:回滚 1% 权重即可去除 Llama 大部分拒答行为
aryaman2020 · x · 2026-09-29
alphaxiv 推荐的论文《Matryoshka Attribution: Learning to attribute language model outputs to representations and weights》提出追踪模型行为到最小内部组件集合的新方法。
- 核心思路:在多个稀疏度层级上同时学习一个排好序的掩码(ranked mask),从而高效隔离紧凑的因果回路(causal circuits)
- 达到 SoTA 的回路定位效果,且首次能把行为归因到权重变化
- 关键实证:在 Llama 3.1 8B 上,只把 1% 的权重回退到基座模型,就能去除大部分拒答(refusal)行为,同时基本保留其余能力
这意味着"安全对齐"可能集中在极小部分权重上,对可解释性和安全机制研究都有直接意义。
「研究」频道最新
- 前沿模型直驱 CAD 与机器人:研究者维护 243 案例动态综述库 — YuXiang_IRVL · 2026-09-29
- 审计数千条 rollout:80% 编程 agent 在脑补不存在的评分器 — jonas__m · 2026-09-29
- f-散度群不变性与 Fisher-Rao 距离:新论文证明统一约化 — FrnkNlsn · 2026-09-29
- Anthropic 联手 Adaptyv 办蛋白质设计赛:首题挑战癌症靶点 EGFR — nc_frey · 2026-09-29
- 免训练专家合并方法 DUME 被 NeurIPS 2026 接收 — benfielding · 2026-09-29
- Feyer Labs 用神经搜索加物理模拟器探索人类想不到的硬件设计 — MarioKrenn6240 · 2026-09-29