OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级
kaicathyc · x · 2026-09-04
OpenAI 发布迄今部署的最强模型 GPT-6 Astra,并同步公开系统卡。要点:
- Astra 是 OpenAI 首个在 Preparedness Framework 下达到网络安全 Critical 级的模型:在合适工具与权限下,可在无人逐步指导下发现未知漏洞并在多重防护系统中开发新利用方式。
- 为此大幅强化防护:防止模型有害网络行动(误用或失准)、内部开发更严格隔离、checkpoint 加密、对包括思维链在内的全轨迹普遍监控、内部使用前设置阻断式对齐评估。
- 鲁棒性显著提升:采用新的鲁棒性安全训练,Astra 对越狱攻击的抵抗力明显高于 GPT-5.6 Sol,包括长轨迹场景;对高风险用户额外训练更保守的拒绝边界,覆盖更多两用风险;并用回归测试与自动化红队持续检验。
- 系统卡还包含大量对齐评估与分析,并坦承对齐与监控仍有未解挑战。
所属事件:OpenAI 发布 GPT-6 Astra 系统卡,网络安全能力首达 Critical 级(12 条相关)→
「模型」频道最新
- Ethan Mollick:用 Astra 级模型要像外包给好团队而非带实习生 — emollick · 2026-09-04
- 用户实测:5.1 版安全分类器明显比上一版更宽松 — repligate · 2026-09-04
- Gemini Live 接入 Gmail、Keep、Docs 等 Workspace 连接器 — testingcatalog · 2026-09-04
- GPT-6 Astra 发布引发争论,网友追忆各自的 AGI「顿悟时刻」 — Sharp_Caregiver_1534 · 2026-09-04
- 前 DeepMind 人士自省:曾看衰 AI 计算机使用,Astra 证明我看错了 — sandersted · 2026-09-04
- 网传OpenAI发布GPT-6 Astra:10万GPU训练,自称AGI达成(未经证实) — AI寒武纪 · 2026-09-04