可解释性圈热议:NLA 输出信任度类比相关性读出

thebasepoint · x · 2026-09-27

thebasepoint 与 @banburismus 讨论对 NLA(network dissection 类线性属性)输出的信任问题:目前对 NLA 输出的信任度并不高,研究者常需通过后续的黑盒因果编辑干预来确认,这种信任建立在一批 evals 和经验之上,与纯相关性读出颇为类似。

他还指出「NLA 也能写作」这一特性目前被低估,部分原因是使用上不够符合人体工学,更外科手术式、可分解的版本会更有前景。

所属事件:可解释性圈热议 NLA 输出的可信度问题(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →