新研究:可解释性工具几乎无法帮 Agent 判断模型行为解释真伪

Sauers_ · x · 2026-10-04

Karvonen、Euan Ong 等研究者发布论文《Would This Change Your Answer? Evaluating Explanations of LLM Behavior in the Wild with Counterfactual Experiments》,用反事实实验评估可解释性(interp)工具对 LLM 行为解释的判别能力。

核心发现:interp 工具并不能帮助 agent 判断某个对模型行为的解释是否为真。

作者给出的原因:

这意味着现有可解释性工具提供的解释在「因果增量信息」上很有限,提示解释性评估需要更严格的反事实检验标准。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →