Anthropic 训练模型自我解释行为并泛化到未见评测

Adam Karvonen 团队(Anthropic Fellows Program 期间完成,作者还包括 Euan Ong、Subhash Kantamneni、Samuel Marks)发布 CHIVE 论文与博客(arXiv:2608.16747),提出让模型解释自身行为的新方法,并证明训练后的自我解释能力可以泛化到未定向训练的评测上。John Schulman 转发并表示看好。

已确认

为什么重要

2026-09-05 ~ 2026-09-05 · 5 条相关

一手来源