CHIVE 论文发布:用反事实实验评估 LLM 行为的野外解释质量
a_karvonen · x · 2026-09-05
论文与博客正式发布(Adam Karvonen、Euan Ong、Subhash Kantamneni、Samuel Marks,Anthropic Fellows Program 期间完成,arXiv:2608.16747)。核心内容:
- 问题:可解释性与 CoT 忠实性研究都需要评估「什么才算好的模型行为解释」。
- 方法:提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits),一个 agentic 流水线,自动发现模型野外异常行为,并通过反事实 prompt 编辑进行调查,产出数千条带反事实证据的自然行为解释。
- 发现一:用反事实可模拟性(counterfactual simulatability)评估常见 LLM 可解释性技术,令人意外的是没有任何一种技术能提升 agent 预测反事实行为的能力。
- 发现二:用 CHIVE 生成训练数据训练模型,可泛化到多种分布外设置。
- 论文:https://arxiv.org/abs/2608.16747
所属事件:Anthropic Fellows 推出 CHIVE:训练模型解释自身行为(2 条相关)→
「研究」频道最新
- Delaunay Canopy 入选 ECCV 2026:稀疏机载 LiDAR 重建建筑线框 — RexDouglass · 2026-09-05
- Niloofar 团队招人:研究 AI Agent 的隐私与情境完整性 — niloofar_mire · 2026-09-05
- 仅 1 比特藏于交流极性:跨 URL 系统可编码丰富隐藏数据 — MoonL88537 · 2026-09-05
- IGI 发布 RNASSTR:基于 Rfam 的 RNA 二级结构预测新数据集 — chaitjo · 2026-09-05
- 新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen · 2026-09-05
- 从行为调查中生成两类自解释训练目标:反事实预测与开放式解释 — a_karvonen · 2026-09-05