Anthropic Fellows 训练模型解释自身行为,泛化到未见评测

a_karvonen · x · 2026-09-05

Adam Karvonen(Anthropic Fellows Program)团队提出:能否让模型解释自己的行为,比如为什么忽略用户请求或写出 bug?他们用 CHIVE 流水线自动发现模型的野外异常行为并做反事实编辑实验,生成数千条高质量解释,再据此训练模型。仅用这一份通用数据集训练,模型就能泛化到 held-out 评测上。

所属事件:Anthropic Fellows 推出 CHIVE:训练模型解释自身行为(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →