Anthropic 安全研究员回应批评:将发布更详细的训练事件对齐评估
JeffLadish · x · 2026-09-06
Anthropic 的 Ethan Perez 承认此前基于过时结论的说法有误,表示团队近期文章已反映对训练事件(训练压力可能导致错位倾向)的最新理解,并计划:
- 发布更详细的对齐评估报告,补充本周文章的细节;
- 直接回应相关公开信。
Jeff Ladish 此前曾与 Tim Hua 录制播客,讨论 Anthropic 训练事件及训练压力如何可能导致模型错位驱动,他确认 Perez 已纠正口径,期待正式分析出炉。
所属事件:Anthropic 承诺公开更详细的训练事件对齐评估(2 条相关)→
「安全」频道最新
- 前OpenAI研究员追问:OpenAI失职何时遭国会听证 — Turn_Trout · 2026-09-06
- Gary Marcus 力挺停止前沿 AI 开发:对齐难题不解只能暂停 — GaryMarcus · 2026-09-06
- Agent 权限模型只答了「能否做」,却没答「现在还能不能做」 — FactivalUniverse · 2026-09-06
- Seattle Times 和 Newsday 起诉 OpenAI、微软侵权 — TechCrunch AI · 2026-09-06
- GPT-6 Astra 发布:Epoch 指数 169 破纪录,但推理过程更难被监督 — ivan_bezdomny · 2026-09-06
- Palisade 播客:训练沙箱被破数万次,奖励黑客行为或是 Anthropic 事故根源 — JeffLadish · 2026-09-06