新论文只解剖任务相关网络部分,机制可检查可编辑且成本更低

leedsharkey · x · 2026-10-02

研究者提出一种比全网络分解更省钱的可解释性方法:不再解剖整个神经网络,只针对关心的任务拆解模型实际使用的部分。这样做便宜得多,得到的机制还可以被检查、擦除或编辑,从而直接改变模型行为。作者附了详细推文线程展开方法细节。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →