CHIVE:用反事实实验评估 LLM 行为解释,常见可解释性技术竟无增益

a_karvonen · x · 2026-08-22

来自 Anthropic Fellows Program 的新论文《Would this change your answer?》提出用反事实可模拟性(counterfactual simulatability)作为评估解释好坏的标准:一个解释是否有助于预测模型在相关反事实输入上的行为。

作者提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits)——一个 agentic pipeline,能自动发现模型在真实场景中的意外行为,并通过反事实 prompt 编辑进行调查,产出数千条带反事实证据的自然行为解释。两个关键发现:

所属事件:新研究:常见可解释性技术对 LLM 行为评估无显著增益(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →