论文质疑可解释性:黑盒提示常胜白盒工具
aryaman2020 · x · 2026-08-22
论文《Pando》探讨当模型拒绝解释自身时,可解释性方法是否依然有效。研究引入了新的模型生物基准来消除“诱导混淆”(即白盒工具的收益可能只是 elicitation 而非内部信号)。
主要发现:
- 在 720 个微调模型上的测试表明,当解释忠实时,黑盒提示的效果匹配或超过所有白盒方法。
- 当解释缺失或误导时,基于梯度的归因可提升 3-5% 的准确率,Relevance Patching (RelP) 收益最大。
- Logit Lens、稀疏自编码器 (SAE) 和电路追踪未提供可靠益处。
- 方差分解显示梯度追踪决策计算,而其他方法受任务表征和偏见主导。
所属事件:研究质疑可解释性工具实用性:NLA 难用且易误导(3 条相关)→
「研究」频道最新
- cwolferesearch 预告 LLM 强化学习综合指南,原稿超两万字 — cwolferesearch · 2026-08-22
- Sunday Robotics ACT-2 模型实现零样本泛化突破 — tonyzzhao · 2026-08-22
- 复旦等提出世界评判模型WCM,149项任务刷新VLA成绩 — jiqizhixin · 2026-08-22
- 研究笔记解析神经网络中的权重叠加干扰现象 — thebasepoint · 2026-08-22
- 思维实验:把 Qwen 27B 模型带回过去,哪年能跑通? — doodlestein · 2026-08-22
- 英伟达用线性代数解决多模型切换 KV 缓存难题 — bendee983 · 2026-08-22