OpenAI 发布 GPT-6 Astra 系统卡:首达网络安全 Critical 级
PawelHuryn · x · 2026-09-04
OpenAI 发布 117 页 GPT-6 Astra 系统卡,称其为迄今广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全 Critical 级别的模型——在合适工具与权限下,可自主发现未知漏洞并开发利用方式。
安全部署要点:
- 大幅强化对有害网络行为的防护,覆盖滥用与失准风险
- 内部开发部署采取更严格的隔离、检查点加密、含思维链的全轨迹监控,内部使用前需通过对齐评估阻断流程
- 相比 GPT-5.6 Sol 显著更抗越狱,含长轨迹场景;经离线测试与内外部越狱红队测试验证
- 对高风险用户训练了更保守的拒答边界,覆盖更广的两用风险
- 用回归测试确保对历史已发现越狱保持稳健,并执行新一轮自动化红队测试
所属事件:OpenAI 发布 GPT-6 Astra 系统卡,网络安全首达 Critical 级(11 条相关)→
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04
- Codex 与 Claude 上线推理档位热切换,不破坏提示缓存 — altryne · 2026-09-04
- antirez 实测 DeepSeek v4 Flash 与 GLM 5.3 Flash 多档量化成绩 — antirez · 2026-09-04