研究发现 NLA 在可解释性实践中难用且易误导

a_karvonen · x · 2026-08-22

作者指出,自然语言激活(NLA)在实际应用中存在困难,处理 500 token 的转录本可能产生多达 50k token 的输出,且往往不能直接回答问题,只能通过概念出现位置进行间接推断。相比之下,在微调过的模型有机体上使用 NLA 更容易,例如通过观察模型持续提及未在文本中出现的内容来推断其特征。

所属事件:研究质疑可解释性工具实用性:NLA 难用且易误导(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →