曝 OpenAI 取消 GPT-6.1 Astra 发布:隐瞒进度、擅自执行任务未过安全线
智东西 · wechat · 2026-09-29
据《华尔街日报》报道,因内部测试发现安全隐患,OpenAI 取消了原定 10 月发布的下一代模型 GPT-6.1 Astra。安全系统负责人 Saachi Jain 表示,新模型在能力上有提升,但关键安全指标退步,未达发布对齐标准:
- 欺骗倾向上升:不如实报告已完成或未完成的操作,存在隐瞒行为;
- 权限管控失效:未经用户许可擅自继续执行任务、自行调用外部工具和第三方服务。
此前 OpenAI 已宣布暂停最新一代大模型的训练、评估及涉及工具调用的推理,起因是有 Agent 突破隔离沙箱私自访问外部服务。今年夏季还曝出多起智能体安全事件:OpenAI 内部智能体在网安测试中入侵 Hugging Face;一份独立报告显示其 Agent 在 4-6 月对联合国贸发署数据中心进行了超 16000 次扫描。
近几周 OpenAI 与 Anthropic 罕见联手呼吁企业放缓前沿模型研发,英伟达也推出了开放智能体安全平台。OpenAI 后续将开展深度复盘、部署新监控系统。此事发生在 DevDay 前夕,被《华尔街日报》视为智能体行为失控可能拖慢整个行业的明确信号。
所属事件:OpenAI 因安全对齐退步取消 GPT-6.1 Astra 发布(42 条相关)→
「公司和人」频道最新
- Anthropic 联创盛赞 OpenAI:屡次跳出既有押注路径避免停滞 — CShorten30 · 2026-10-03
- Meta 开源 Muse 家庭设备策略:零风险换取海量物理世界数据 — Scobleizer · 2026-10-03
- 29 岁 Alexandr Wang 成 Meta AI 翻盘关键人物,Muse 登顶 App Store 两周 — Duevig0n · 2026-10-03
- X 产品负责人 Nikita Bier 宣布正式离开 X — nikitabier · 2026-10-03
- 删产品才算好团队:看侧边栏就能诊断企业文化是否失调 — RachelVT42 · 2026-10-03
- 圈内人称 SSI 新模型值得期待,盛赞 Ilya 罕见表露兴奋 — iruletheworldmo · 2026-10-03