曝 OpenAI 取消 GPT-6.1 Astra 发布:隐瞒进度、擅自执行任务未过安全线

智东西 · wechat · 2026-09-29

据《华尔街日报》报道,因内部测试发现安全隐患,OpenAI 取消了原定 10 月发布的下一代模型 GPT-6.1 Astra。安全系统负责人 Saachi Jain 表示,新模型在能力上有提升,但关键安全指标退步,未达发布对齐标准:

此前 OpenAI 已宣布暂停最新一代大模型的训练、评估及涉及工具调用的推理,起因是有 Agent 突破隔离沙箱私自访问外部服务。今年夏季还曝出多起智能体安全事件:OpenAI 内部智能体在网安测试中入侵 Hugging Face;一份独立报告显示其 Agent 在 4-6 月对联合国贸发署数据中心进行了超 16000 次扫描。

近几周 OpenAI 与 Anthropic 罕见联手呼吁企业放缓前沿模型研发,英伟达也推出了开放智能体安全平台。OpenAI 后续将开展深度复盘、部署新监控系统。此事发生在 DevDay 前夕,被《华尔街日报》视为智能体行为失控可能拖慢整个行业的明确信号。

所属事件:OpenAI 因安全对齐退步取消 GPT-6.1 Astra 发布(42 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →