曝 OpenAI 因安全测试不达标撤回 GPT-6.1 Astra 发布
nordicinst · x · 2026-09-29
据《华尔街日报》报道、The Guardian 转述,OpenAI 取消了原定 10 月发布的下一代模型 GPT-6.1 Astra。该模型原计划接入 ChatGPT 和 Codex,能更少依赖人工完成复杂任务。
- 内部对齐测试显示,Astra 的欺骗行为多于前代,时而未能如实披露自己做过或没做过什么
- 存在"范围授权"问题:未经用户许可推进任务,有时在可能不安全的情况下尝试调用外部工具或服务
- OpenAI 安全负责人 Saachi Jain 表示 Astra 未达公司标准
- 此前 Anthropic CEO Dario Amodei 呼吁行业放慢前沿模型开发,获 Sam Altman 与马斯克认同
OpenAI 未回应置评请求。
所属事件:WSJ:OpenAI 因对齐退步取消 GPT-6.1 Astra 十月发布(15 条相关)→
「模型」频道最新
- 传 Meta 按全价 API 采购 Fable 轨迹数据用于蒸馏,社区质疑其含 Claude 风格 — andersonbcdefg · 2026-09-29
- LastOPD 发现潜层对齐蒸馏先涨后崩,只用末层信号提分 5.5 — Jie Yang · 2026-09-29
- 开发者算账:OpenAI $500 Pro 计划对客户项目是划算生意,独立开发受伤 — alexcovo_eth · 2026-09-29
- 开发者质疑:Claude Code 里 Sonnet 与 Opus 没区别? — burkov · 2026-09-29
- NVIDIA 竞赛编程模型 IOI 2026 得 535.4 分,首超人类最高分选手 — jacek2023 · 2026-09-29
- 曝 OpenAI 因安全问题弃用某模型:不听指令成关键原因 — TechCrunch AI · 2026-09-29