Anthropic 训练模型自我解释行为并泛化到未见评测
Adam Karvonen 团队(Anthropic Fellows Program 期间完成,作者还包括 Euan Ong、Subhash Kantamneni、Samuel Marks)发布 CHIVE 论文与博客(arXiv:2608.16747),提出让模型解释自身行为的新方法,并证明训练后的自我解释能力可以泛化到未定向训练的评测上。John Schulman 转发并表示看好。
已确认
- 研究动机:让模型解释自己的行为,例如为什么忽略用户请求、为什么写出含 bug 的代码。
- 方法:用 CHIVE 流水线自动发现模型在野外的异常行为,并通过反事实编辑实验生成数千条高质量、基于模型真实行为的解释,构成单一通用数据集用于训练。
- 结果:训练后的模型在 held-out 评测上表现出泛化能力,包括 hint 评测(「移除 hint 会不会改变你的回答?」)及其他评测。
- 泛化突破:作者指出以往自我解释训练泛化范围很窄(如只在一种 hint 格式之间迁移),原因是数据集太窄;本研究未针对 hint 训练,仍提升了 hint 评测表现。
- 跨模型训练:将 Qwen 训练在针对 Llama 行为的调查数据上(反之亦然),交叉训练效果与自我训练相当,说明无需模型对自身行为的特权访问(privileged access)。
- 局限:作者承认开放式自我解释目前仍不够可靠。
为什么重要
- 该方法将可解释性从外部分析推进到模型可训练地自我解释,且解释基于真实行为而非编造,配合可度量指标,可能成为模型安全审计与行为诊断的实用工具。
2026-09-05 ~ 2026-09-05 · 5 条相关
一手来源
- Anthropic Fellows 训练模型解释自身行为,泛化到未见评测 — a_karvonen ·
- CHIVE 论文发布:用反事实实验评估 LLM 行为的野外解释质量 — a_karvonen ·
- 新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen ·
- 【源头】Anthropic Fellows 训练模型解释自身行为,泛化到未见评测 — a_karvonen · 2026-09-05
- 【源头】新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen · 2026-09-05
- 跨模型训练同样有效:Qwen 学 Llama 的解释不劣于自我训练 — a_karvonen · 2026-09-05
- 【源头】CHIVE 论文发布:用反事实实验评估 LLM 行为的野外解释质量 — a_karvonen · 2026-09-05
- Anthropic 训练模型用数千条真实行为解释学会自我解释 — a_karvonen · 2026-09-05