Activation Oracles 作者亲口承认:这不是机械可解释性方法

saprmarks · x · 2026-09-07

saprmarks(activation oracles 论文作者之一)在 X 上回应争议:他不认为 activation oracles、NLA 这类方法属于「机械可解释性」(mech interp),并指出论文里就有一节明确写着「Activation Oracles 是一种根本上非机械化的 LLM 激活解释技术」。这与评论中「这类方法虽不符合 mech interp 定义、却将成为多数自我标榜 mech interper 的主攻方向」的判断形成呼应。在同串讨论中也有人主张,前沿实验室在生产环境部署的 probes 应算可解释性研究的重大成果,其改进确实受益于 mech interp 研究。

所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →