Anthropic Fellows 训练模型解释自身行为,泛化到未见评测
a_karvonen · x · 2026-09-05
Adam Karvonen(Anthropic Fellows Program)团队提出:能否让模型解释自己的行为,比如为什么忽略用户请求或写出 bug?他们用 CHIVE 流水线自动发现模型的野外异常行为并做反事实编辑实验,生成数千条高质量解释,再据此训练模型。仅用这一份通用数据集训练,模型就能泛化到 held-out 评测上。
所属事件:Anthropic Fellows 推出 CHIVE:训练模型解释自身行为(2 条相关)→
「研究」频道最新
- Delaunay Canopy 入选 ECCV 2026:稀疏机载 LiDAR 重建建筑线框 — RexDouglass · 2026-09-05
- Niloofar 团队招人:研究 AI Agent 的隐私与情境完整性 — niloofar_mire · 2026-09-05
- 仅 1 比特藏于交流极性:跨 URL 系统可编码丰富隐藏数据 — MoonL88537 · 2026-09-05
- IGI 发布 RNASSTR:基于 Rfam 的 RNA 二级结构预测新数据集 — chaitjo · 2026-09-05
- 新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen · 2026-09-05
- 从行为调查中生成两类自解释训练目标:反事实预测与开放式解释 — a_karvonen · 2026-09-05