可解释性讨论:NLA 能否从激活中提取模型全部潜在信息

thebasepoint · x · 2026-09-27

围绕 NLA(自然语言消融)的一场可解释性讨论:作者提出一种理解框架——NLA 的一种目标是从激活中提取模型「原则上能说」的一切,而不受「助手此刻会说」的限制。他还提到 OpenAI 的 confessor training 似乎是想让这一性质成立的尝试,但自 1 月以来未见其原型之外的进展。这条对可解释性研究方向有实质信息量。

所属事件:可解释性研究者激辩 NLA 方法的能力边界(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →