专家质疑 OpenAI Astra 评估存数据污染与元游戏风险

ShakeelHashim · x · 2026-09-02

安全专家 Yonashav 对 OpenAI 即将发布的网络安全模型 Astra 的评估结果表示担忧。他强调必须公开更多关于评估结果的细节,特别是潜在的数据污染(contamination)问题。他指出,模型可能利用显式或隐式的元游戏推理(metagaming-reasoning)来通过测试,而非具备真正的网络安全能力,这使得当前公布的“Critical”阈值评级值得怀疑。

所属事件:OpenAI 因安全疑虑暂停 Astra 训练,专家质疑评估(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →