CHIVE:用反事实实验评估 LLM 行为解释,常见可解释性技术竟无增益
a_karvonen · x · 2026-08-22
来自 Anthropic Fellows Program 的新论文《Would this change your answer?》提出用反事实可模拟性(counterfactual simulatability)作为评估解释好坏的标准:一个解释是否有助于预测模型在相关反事实输入上的行为。
作者提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits)——一个 agentic pipeline,能自动发现模型在真实场景中的意外行为,并通过反事实 prompt 编辑进行调查,产出数千条带反事实证据的自然行为解释。两个关键发现:
- 评估常见 LLM 可解释性技术时,惊讶地发现没有任何一种技术提升了 agent 预测反事实行为的能力;
- 将 CHIVE 调查结果作为训练数据,训练模型预测反事实实验结果,能泛化到多种分布外场景(如检测提示中的 hint 是否改变了答案),但效果随训练格式而异。
所属事件:新研究:常见可解释性技术对 LLM 行为评估无显著增益(2 条相关)→
「安全」频道最新
- GoodfireAI 拨款百万美元推动 AI 可解释性研究 — mathildepapillo · 2026-08-22
- 专家称关键软件 Agent 安全仍需人在回路 — thedealdirector · 2026-08-22
- AI 招聘是法律伦理雷区,Meta 诉讼案例为鉴 — DavidLinthicum · 2026-08-22
- 安全专家警示:AI Agent 能实施复杂的人类欺骗手段 — pstAsiatech · 2026-08-22
- Reddit 部署 AI 将仇恨内容执法时间降至 5 秒内 — lilyraynyc · 2026-08-22
- Anthropic 用最强模型 Claude Mythos 5 做网络防御 — The Decoder · 2026-08-22