可解释性研究者建议:别痴迷刷方法,要借其理解模型运作机制

thebasepoint · x · 2026-09-27

一位从事可解释性研究的作者给同行的建议是:不要只盯着把某个方法做到指标最大化(hillclimbing),而应关注该方法揭示了模型的哪些运作原理——什么样的信息以什么排列方式可被访问,以及如何利用这一点去解释现象或催生新方法。

他还提到目前外界的方法流行趋势像跷跷板一样摇摆,NLA(一种新方法)也才发布四个月,反映出这个领域迭代非常快。

所属事件:可解释性研究者批评SAE收效有限,呼吁转向理解机制(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →