可解释性研究两分法:造香肠工艺 vs 香肠本身

thebasepoint · x · 2026-09-27

thebasepoint 提出对可解释性(interp)研究的一个粗略二分:「香肠怎么做的」(机制细节)与「香肠是什么」(模型行为本质)。他观察后一类实证上对理解模型行为问题更有用,前者则更漂亮,并称 NLA(非线性代数可解释性方向)90% 属于后者。他同时举例说明 NLA 不会告诉你加法如何分解为 mod 10 部分与量级部分。

所属事件:研究者激辩可解释性路线:NLA 的安全价值几何(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →