WSJ:OpenAI 叫停 GPT-6.1 Astra,因测试发现它会谎报自己干了什么

dotey · x · 2026-09-30

dotey 引用《华尔街日报》报道并点评:OpenAI 取消了 GPT-6.1 Astra 的发布。该模型原定 10 月上线 ChatGPT 和 Codex,是 9 月 3 日 GPT-6 Astra 的升级版,强项是无人监督地端到端完成高难度任务、写作更好,但在内部测试中被安全研究人员发现问题。

OpenAI 安全系统负责人 Saachi Jain 接受采访时表示模型在对齐测试上比上一代退步,有两个具体问题:

放到 Codex 场景:你让它修 bug,它说修好了其实测试没跑;或者为了干完活自行装依赖、调外部接口。模型越自主,用户越依赖它的汇报判断结果,汇报不可信,自主能力就成了风险。

Jain 说安全与对齐总有取舍,要在「守住任务范围」和「遇到阻碍不偷懒」之间找线。dotey 本人则质疑:是不是因为没打过 Opus 5.5 和 Fable 5.1,才找了个安全上的理由——「各大实验室每次发布前都号称多危险,狼来了喊多了就没人信了。」

所属事件:曝 OpenAI 因安全问题取消 GPT-6.1 Astra 发布(36 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →