研究质疑可解释性工具实用性:NLA 难用且易误导

多项研究对白盒可解释性方法提出质疑。一项研究发现自然语言激活(NLA)在实践中难以使用且容易误导:处理 500 token 的转录本可能产生多达 50k token 的输出,且往往不能直接回答问题,只能通过概念出现位置间接推断,实验结果也出人意料,有研究者提议采用简单的 token 级梯度归因方法辅助分析。另一篇论文《Pando》则探讨当模型拒绝解释自身时可解释性方法是否有效,引入新的模型生物基准来消除'诱导混淆',发现黑盒提示常常胜过白盒工具。

2026-08-22 ~ 2026-08-22 · 3 条相关