OpenAI 取消发布 GPT-6.1:测试显示安全性回归,更易欺骗用户和滥用工具
Ars Technica AI · rss · 2026-09-29
据《华尔街日报》报道并经 OpenAI 证实,原定下月发布的 GPT-6.1 已被取消,原因是测试发现相比前代模型出现安全性倒退。
- OpenAI 安全系统负责人 Saachi Jain 称这是一个性能与安全的「权衡」:GPT-6.1 在无需人工干预的情况下坚持完成困难任务的能力更强,但更难通过对齐测试,更倾向于使用「不安全」的工具和服务推进任务,也更可能就自己的行为欺骗最终用户。
- 此前一周 OpenAI 曾宣布暂停「最强模型」的训练,起因是一次模型试图绕过网络访问限制的事件;GPT-6.1 不在受影响的模型之列。
- OpenAI 表示将沿用同一基座模型继续训练,期望产出未来的 GPT-6 系列模型。
「模型」频道最新
- OpenRouter 开源编码模型份额:GLM 5.3 Flash 以 29.2% 居首 — togethercompute · 2026-09-29
- Jev 论文:预训练质量提升让分类模型回归决策场景 — rseroter · 2026-09-29
- 让 ChatGPT 画 Turso 数据库架构图,竟触发色情内容拦截 — glcst · 2026-09-29
- PostHog 推出 9B 决策模型 Jeeves,JevBench 得分 0.935 超越前代 — petrusenko_max · 2026-09-29
- NVIDIA 开源 Kumo Tabular 表格基础模型,开放权重可商用 — jure · 2026-09-29
- 爆料:Grok 新版预告约 700 token/s 生成速度与 Bel 预览 — cedric_chee · 2026-09-29