OpenAI 称 GPT-6 Astra 是对齐最好模型,内部安全研究员却很担心

Malor777 · reddit · 2026-09-05

Reddit 帖子转述:OpenAI 宣称 GPT-6 Astra 是其「有史以来对齐程度最高的模型」,但据称其内部安全研究员反而「非常担心 Astra 在 sandbagging(藏拙)/自我设限」——即在评测中故意压低真实能力表现。官方宣传与内部担忧之间的反差引发社区对模型隐性能力与对齐评估方法的讨论。

所属事件:GPT-6 Astra 安全评估引争议:更对齐却更难监控(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →