专题 · FULL STORY

NLA 可信度之争:可解释性路线的激辩

9 月下旬,研究者 banburismus_ 公开质疑 NLA 类方法的输出如何获得「机制上正确」的信心,引发可解释性圈关注;随后与 thebasepoint 等人就 interp 研究的安全价值连日交锋,争论持续发酵,尚未有定论。

2026-09-25 ~ 2026-09-27 · 2 集 · 10 条

第 1 集 · 可解释性圈热议 NLA 输出的可信度问题(2026-09-25,2 条)

可解释性研究者 banburismus 对 NLA(非线性表征/机制可解释性分析类方法)的走红提出质疑:这类方法的输出如何在「机制上是对的」这一意义上获得信心?随后 thebasepoint 等人加入讨论,将当前对 NLA 输出的信任度类比为相关性读出,认为目前学界对此类输出的信任程度并不高,相关争议在可解释性社区持续发酵。

第 2 集 · 研究者激辩可解释性路线:NLA 的安全价值几何(2026-09-27,8 条)

9 月 27 日,AI 安全研究者 banburismus 与 thebasepoint 在多则帖子中就可解释性研究(interp)的价值展开交锋,焦点集中在 NLA(自然语言消融/自然语言抽象)对前沿安全到底有多大用处。

已确认

  • thebasepoint 提出理解 NLA 的一种框架:其目标之一是从激活中提取模型「原则上能说」的一切,而不局限于「助手此刻会说」的内容;他认为 OpenAI 的 confessor training 似乎也在追求类似方向。
  • thebasepoint 对可解释性研究给出一个粗略二分:「香肠怎么做」(模型内部机制,更优美)与「香肠是什么」(模型行为本质,实证上对理解模型行为问题更有用);他并称 NLA 约九成属于后者一类。
  • 他同时指出 NLA 的局限:这类方法并不能揭示如「加法分解为模 10 部分与量级部分」这样的内部结构,在机制发现上能力有限。

为什么重要

  • 这场讨论触及可解释性研究的核心路线之争:是深挖内部机制,还是聚焦行为层面的可解释性。thebasepoint 的观察是后者在实证上更有效,但前者在理论上更优美,这对安全研究资源配置具有参考意义。
  • NLA 与 OpenAI confessor training 之间的关联提示,「让模型说出其潜在状态」正成为一条受关注的安全技术路径,但其在机制层面的解释力仍存争议。