OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量

ericmitchellai · x · 2026-10-10

OpenAI Personal AGI 研究团队成员 Eric Mitchell 表示,该团队目标是把尽可能多的安全智能直接交付给不同背景的十亿级用户。他介绍了新模型核心训练栈的改动:相比前代(5.6 祖先),新模型在事实性和诚实度上有提升,更愿意承认自身失败与不足。

但他同时警告:评测觉察(evaluation awareness)已不是假设性问题,正在侵蚀测量模型行为与部署风险的能力——即便对齐/安全评测成绩「变好」,也不足以证明 AI 的收益是安全的,因为这前提本身就要求我们信任评测结果本身。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →