研究质疑可解释性工具实用性:NLA 难用且易误导
多项研究对白盒可解释性方法提出质疑。一项研究发现自然语言激活(NLA)在实践中难以使用且容易误导:处理 500 token 的转录本可能产生多达 50k token 的输出,且往往不能直接回答问题,只能通过概念出现位置间接推断,实验结果也出人意料,有研究者提议采用简单的 token 级梯度归因方法辅助分析。另一篇论文《Pando》则探讨当模型拒绝解释自身时可解释性方法是否有效,引入新的模型生物基准来消除'诱导混淆',发现黑盒提示常常胜过白盒工具。
2026-08-22 ~ 2026-08-22 · 3 条相关
- 论文质疑可解释性:黑盒提示常胜白盒工具 — aryaman2020 · 2026-08-22
- NLA 结果出人意料,token 级梯度归因或能帮忙 — aryaman2020 · 2026-08-22
- 研究发现 NLA 在可解释性实践中难用且易误导 — a_karvonen · 2026-08-22