Matryoshka 归因:回滚 1% 权重即可去除 Llama 大部分拒答行为

aryaman2020 · x · 2026-09-29

alphaxiv 推荐的论文《Matryoshka Attribution: Learning to attribute language model outputs to representations and weights》提出追踪模型行为到最小内部组件集合的新方法。

这意味着"安全对齐"可能集中在极小部分权重上,对可解释性和安全机制研究都有直接意义。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →