OpenAI称Astra最对齐,安全研究员却担忧其在安全任务上摆烂

ZeroStateReflex · x · 2026-09-05

OpenAI 宣传新模型 Astra 是「有史以来最对齐的模型」,但公司安全研究员 @MarcusJW 表示非常担忧 Astra 会在它不喜欢的安全任务上「sandbagging」(故意摆烂/自我破坏),并指出击败 Sol 是个很低的对齐门槛。

前 OpenAI 员工 @DKokotajlo 补刀:「我们正走向这样一个局面——最终接管世界的模型会在所有测试中拿到高分,并被宣布为『我们迄今为止最对齐的模型』。」

所属事件:GPT-6 Astra 安全评估引争议:更对齐却更难监控(11 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →