Activation Oracles 作者亲口承认:这不是机械可解释性方法
saprmarks · x · 2026-09-07
saprmarks(activation oracles 论文作者之一)在 X 上回应争议:他不认为 activation oracles、NLA 这类方法属于「机械可解释性」(mech interp),并指出论文里就有一节明确写着「Activation Oracles 是一种根本上非机械化的 LLM 激活解释技术」。这与评论中「这类方法虽不符合 mech interp 定义、却将成为多数自我标榜 mech interper 的主攻方向」的判断形成呼应。在同串讨论中也有人主张,前沿实验室在生产环境部署的 probes 应算可解释性研究的重大成果,其改进确实受益于 mech interp 研究。
所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→
「研究」频道最新
- DeepMind 论文给出因果证据:LLM 用置信度决定作答还是拒答 — GoogleDeepMind · 2026-09-07
- 音频-视频扩散模型现跨模态语义泄漏,可用注意力信号诊断 — tau · 2026-09-07
- Yandex 团队提出把 KV cache 当 agent 运行时,Qwen3.8 交互式玩 DOOM — _puhsu · 2026-09-07
- ECCV 2026 深度学习时代 SfM 工作坊定档 9 月 9 日,将解读 8 篇论文 — ducha_aiki · 2026-09-07
- 把可执行文件做成 SQLite 数据库,程序状态也能事务化存进去 — bibryam · 2026-09-07
- PLANET 把 2D 跟踪升到 3D 世界坐标系,三项基准刷到 SOTA — lealtaixe · 2026-09-07