OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级
peterjliu · x · 2026-09-04
OpenAI 正式发布 GPT-6 Astra 系统卡,称其为迄今广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全 Critical 级别的模型。
要点:
- 网络安全能力大幅跃升:在合适工具与权限下,Astra 可在无人逐步引导的情况下发现未知漏洞并在防护良好的系统中开发新利用方式;OpenAI 已强化防护,包括更严格的内部隔离、checkpoint 加密、包含 CoT 的全轨迹监控、内部使用前的阻断式对齐评估。
- 抗越狱能力显著增强:采用新的鲁棒性安全训练,对越狱攻击明显强于 GPT-5.6 Sol;对高风险用户收紧拒绝边界,并通过回归测试与自动化红队覆盖历史漏洞。
- 官方文档同时承认 Astra 的可监控性相对 GPT-5.6 Sol 有所下降(系统卡由 Deployment Safety Hub 发布)。
所属事件:OpenAI 发布 GPT-6 Astra,官宣「AGI 时代」引跑分争议(390 条相关)→
「模型」频道最新
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- OpenAI 官员确认:Astra 纳入套餐正常用量,额度可 100% 划拨 — soumitrashukla9 · 2026-09-05
- 罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分 — danielmckinn0n · 2026-09-05
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- TheZvi 解读 Claude Fable 5.1 系统卡:200+ 页安全评估要点 — TheZvi · 2026-09-05
- COLM 论文:思维链看着可读不等于真的重要 — LauraRuis · 2026-09-05