OpenAI 发布模型失范报告框架,安全研究者称同类最佳

S_OhEigeartaigh · x · 2026-09-18

AI 安全研究者评论 OpenAI 近期举措:其坦率披露 Astra 模型可监控性下降并承诺研究成因与缓解;新发布的「模型失范报告框架」在同类机制中最佳,希望其他公司跟进,但关键在于落实。评论者同时指出 DeepMind 过去曾严格管控员工谈论 x-risk 的言论,认为其行为未必已成历史。

所属事件:OpenAI 发布模型失准披露框架并公开六份案例报告(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →