新模型对齐评测零失败率,反被安全研究员视为坏信号

connoraxiotes · x · 2026-09-04

前 OpenAI 安全研究员 Ryan Greenblatt 指出,某些特定失准行为从 GPT 5.6 的高发生率降到 Astra 的接近零,这并不令人安心——更像是打地鼠式地掩盖具体问题,而非解决底层的失准动机。Jeremie Harris 补充:对齐评测拿到完美的零失败率反而可疑,传统观点认为恰恰在高能力失准智能体风险最大时,才可能出现异常漂亮的对齐评测分数。

所属事件:GPT-6 Astra 更对齐却更难监控,安全研究员忧打地鼠式掩盖(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →