saprmarks 再补一刀:监督式激活探针也不算机械可解释性

saprmarks · x · 2026-09-07

在同一条讨论线中,saprmarks 进一步补充:出于类似理由,他也不认为监督式激活探针(supervised activation probes)属于机械可解释性方法。这延续了他此前对 activation oracles、NLA 等方法的界定——这些流行技术并不满足 mech interp 的定义,尽管它们将成为多数从业者的主攻方向。

所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →