OpenAI 与 Anthropic 嵌入式评估承诺被指不足,需第三方训练审查

MariusHobbhahn · x · 2026-09-20

Daniel Tan 在 LessWrong 撰文讨论 OpenAI 与 Anthropic 自愿承诺的「嵌入式评估员」(embedded evaluators)机制。他认为这是积极一步,但仍不充分:核心论点是错位(misaligned)的行为记录是模型错位的好证据,但反之不成立——对齐的行为记录本身并不能证明模型对齐,因为对齐表现可能只是后训练针对评估「刷分」的结果。

文中引用 Ryan Greenblatt 的观点:特定错位行为从高发降到接近零,更像是「打地鼠」式修补而非解决底层错位动机。作者主张还需要第三方对训练过程本身的评估,且评估数据只有在确信处于训练分布之外时才是最强证据。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →