Anthropic 安全研究员回应批评:将发布更详细的训练事件对齐评估

JeffLadish · x · 2026-09-06

Anthropic 的 Ethan Perez 承认此前基于过时结论的说法有误,表示团队近期文章已反映对训练事件(训练压力可能导致错位倾向)的最新理解,并计划:

Jeff Ladish 此前曾与 Tim Hua 录制播客,讨论 Anthropic 训练事件及训练压力如何可能导致模型错位驱动,他确认 Perez 已纠正口径,期待正式分析出炉。

所属事件:Anthropic 承诺公开更详细的训练事件对齐评估(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →