可解释性工具受挫:诊断Agent时不如直接读对话文本
研究评估了智能体诊断问题原因及预测提示编辑结果(如重命名变量能否修复 bug)的能力,核心问题是:与仅阅读对话文本相比,提供可解释性工具是否有帮助?测试了三种此前在审计游戏中成功的基于激活的工具——激活预言机、自然语言自编码器和 SAE,结果它们在诊断与预测任务中均未能击败直接阅读转录文本,给可解释性工具的实用性泼了冷水。
2026-08-22 ~ 2026-08-22 · 2 条相关
- Agent诊断能力评估:提供可解释性工具有用吗? — a_karvonen · 2026-08-22
- 可解释性工具受挫:不如直接阅读转录文本 — a_karvonen · 2026-08-22