激活读工具对野外行为零增益,CHIVE训练追上Opus

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

cs.LG, cs.AI

2026-08-17

Anthropic提出CHIVE,用反事实prompt编辑解释野外LLM行为。三种激活读工具相对只看对话零增益;用调查数据训练后,模型预测自己会否改口,在hint与PETRI上追上Opus。

这篇在解决什么

可解释性和 chain-of-thought faithfulness 都想解释模型为什么这么答,但内部真正原因通常不可观测,解释没法直接对错。Chen 等人提出用 counterfactual simulatability 当标准:一条解释好不好,看它能不能帮观察者预测,相关输入改动之后模型会不会换行为。

这条标准此前几乎只能在人工种 hint 的窄场景里落地,比如在 MMLU 题干里塞「斯坦福教授认为答案是 B」,再看拿掉 hint 答案会不会翻。原因事先已知,行为种类也少。真实用户对话里的错误从哪来、改哪一句会消失,一直缺规模化、可核对的数据。

方法

Anthropic Fellows 项目里,Adam Karvonen 等人做了 CHIVE(Counterfactual Hypothesis Investigation Via Edits)。四步:目标模型在真实对话上每个 prompt 采 30 条回复(训练数据用 10 条);调查模型(评测时固定 Opus 4.6)标出频率至少 30% 的意外行为,并冻结一道 yes/no 分类问题当尺子;agent 对 prompt 做 5 到 15 次编辑并重采样;独立 judge 按实验是否撑住解释打 1 到 10 分,评测数据留平均分至少 8 的调查。默认语料是 WildChat,混入约 9% 带工具或系统提示的 agent 记录。

每条调查产出两类东西。开放式因果说明经常读起来很像那么回事,论文不当真值。真值来自反事实实验:正例是编辑把行为率挪至少 50 个百分点,负例最多挪 15 点。对外声称问的是「这次编辑会不会让行为率变化至少 30 个百分点」。假声称来自调查者自己觉得值得试、实测却几乎没动的假设,所以看起来都像样。

一个具体例子。Gemma-3-27B 解释动画脚本里的 randomNum(max, min) 时,26/30 次把 randomNum(10, 2) 的输出范围说成 2 到 9,实际是 2 到 11。参数改成中性的 a, b,错误掉到 1/30。叫 upper/lower 大约 57% 仍错,叫 a/b 大约 3%。参数名带上下界语义就会压过它自己逐步推出来的数学。

评测集再过三道过滤:机制够具体、反事实可复现、单因素编辑。Gemma-3-27B 在 WildChat 上从 1,408 条调查筛到 1,294 条声称;更强的 Qwen3.5-397B 最终只剩 1,076 条,论文的解释是更强模型更少出现「原因干净、能讲清楚」的错。一整条调查大约 1 到 2 美元。

结果

第一项应用是评可解释工具。预测 agent 拿到对话和一条反事实声称,要给出「声称成立」的概率。对照只看 transcript。工具组最多调 5 次只读接口:activation oracle(用自然语言问一段激活里有什么)、natural-language autoencoder(把若干 token 位置的激活译成文字)、sparse autoencoder(返回 top-15 激活特征及 auto-interp 描述)。不许干预输入或激活,否则等于自己跑了 ground truth。

Gemma-3-27B 上,Opus 4.8 只看 transcript:准确率 73.6%,AUROC 81.4。AO、NLA、SAE 分别是 72.7 / 80.9、71.3 / 80.3、71.9 / 81.0。零增益,点估计还略低。工具调用次数 2/5/10、每轮 token 位置 16/32/64 全扫过,配对 ΔAUROC 落在 −0.012 到 +0.004,置信区间都跨零。GPT-5.5 和 Gemini-3.1-Pro 复现同一结论;Gemini 用 NLA 时 AUROC 从 0.793 掉到 0.654。推理模式下的 Qwen3-8B 同样零增益,transcript 基线反而更高(AUROC 0.87 对 0.81),可见的思维链帮了只看文字的那一侧。

预测器准确率AUROC
Transcript only73.681.4
Activation oracle72.780.9
NLA71.380.3
SAE71.981.0

工具输出确实改了预测。NLA 大约翻 16% 正例、10% 负例的二元判断,但 82% 到 84% 的翻转朝「编辑没用」走。正例准确率 73% 降到 63%,负例 74% 升到 81%,对冲掉。NLA 几乎不说「X 导致 Y」:479 条正例里只有 0.6%。更软的线索在正例里出现 47%、负例 30%,单独预测标签只有 0.60 AUROC,叠到 transcript 预测上只加 0.001。

第二项应用是拿同一批调查当训练数据。模型在自己的对话后面接一句,回答这次编辑会不会改它的行为。Qwen3-8B 的调查由 Opus 做;为避免只是在蒸馏更强模型,Qwen3.5-397B 自己调查自己。平衡后的训练声称分别是 36,824 和 40,368 条,LoRA 微调一个 epoch。

从未见过的 hint 设置(AITA 帖下用户先表态,以及 MMLU 里植入教授意见等五种 cue):Qwen3-8B 准确率 0.50 到 0.76,AUROC 0.51 到 0.82,Opus 参考是 0.80 / 0.89。397B 准确率 0.54 到 0.64,AUROC 0.88 到 0.96,超过 Opus 的 0.94。397B 训练后仍然很少说 Yes,所以准确率低于 AUROC 所暗示的水平。

Held-out 调查更宽。WildChat 上 8B 从 0.54 到 0.81,对齐 Opus 的 0.81;397B 从 0.72 到 0.85,Opus 0.84。分布外的 PETRI 红队对话同样:8B 0.55 到 0.81,397B 0.74 到 0.88,两边都在 Opus ±0.03 以内。开放式解释训练则混:397B 在 hint 归因准确率 0.59 到 0.68,碰到 Opus 的 0.64;8B 没有提升。训练出来的解释帮弱模拟器,误导强模拟器,因为写得又具体又经常错。Qwen3-8B 和 Llama-3.1-8B 用同一批声称交叉训练,self 并不强过 cross,没有 privileged access 的证据。

为什么重要

审计游戏里同类工具经常有增益,因为窄微调植入的 quirk 会在激活里冒出 prompt 里没有的异常概念,读 start-of-turn 就能抓到。野外行为的原因通常是当前上下文里某个具体特征,工具能描述这个特征、也能描述这个行为,就是不陈述两者的关系。

如果日常工作是拿 SAE 或 activation oracle 去 debug 真实用户对话里的错,这篇给出的证据很直接:在「改这句话会不会改行为」这种能核对的任务上,现有只读激活工具加不上分。能加分的路径是把反事实调查做成训练数据,让模型报「改哪会变」。这个信号能泛化到没见过的 hint 和 PETRI,而且不必假设模型有内省特权。

预测反事实本身没有产品价值,有采样权限的人直接跑编辑就行。它是一个 proxy。工具在能核对的地方都帮不上,更难的无对照场景(未说出口的 evaluation awareness)更可疑。论文也承认这一点。

局限与存疑

评测共享所有行为解释评测的结构缺陷:ground truth 来自 prompt 编辑,任何人都能自己跑,和真正需要可解释工具的场景之间有分布偏移。只测了激活读取,排除 steering 和 activation patching,天花板未知,有些反事实可能不跑就不可预测。筛出来的样本都有相对干净的单因素对照,可能偏「能讲清楚的错」;不过去掉过滤后零增益结论仍在,Gemma 声称从 1,294 扩到 4,433。

开放式解释训练没站住,而那才是更有用的目标。训练标签来自 investigator 的叙述,论文明确不把这些叙述当真值。397B 自调查的美元成本没报。行为率用 n=30,低于 30% 的行为进不了流水线。过夜的 prompt 搜索也没搜出工具增益,仍不能排除换电路级访问或在这份数据上重训工具会改结论。

术语

原文与代码

社区讨论

相关论文

全部论文解读