研究发现:单个网络组件无法完整解释模型预测计算

Sauers_ · x · 2026-10-02

作者引用可解释性研究观点:表现最好的网络组件「远不能完整解释模型预测背后的相关计算」。被引原帖举例:基础模型在「The princess lost...」后能预测「her」,是因为存在两条独立计算通路——princess 词元的女性语义,加上动词后代词预测的语法通路。这意味着归因到单一组件的可解释性方法存在明显局限。

所属事件:Goodfire发布VPD参数分解法,拆解语言模型内部结构(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →