OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级
deanwball · x · 2026-09-04
OpenAI 发布 GPT-6 Astra 系统卡,称其为迄今广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全 Critical 级的模型。
- 网络能力:在合适工具与权限下,Astra 可在无人逐步引导的情况下发现未知安全漏洞、开发新的利用方式,针对多个防护严密的系统
- 内部防护:更严格的隔离、checkpoint 加密、对包含思维链(CoT)的全轨迹通用监控、内部使用前的阻断式对齐评估
- 越狱鲁棒性:采用新的鲁棒性安全训练,显著强于前代 GPT-5.6 Sol,包括更长轨迹上的表现;对高风险用户收紧拒绝边界、覆盖更广双用途风险,并用回归测试和自动化红队持续验证
- 系统卡还覆盖可监控性(monitorability)、agent 安全等多项安全工作
所属事件:OpenAI 发布 GPT-6 Astra 系统卡,网络安全能力首达 Critical 级(4 条相关)→
「模型」频道最新
- UK AISI 实测:Astra 时间跨度达 30.9 分钟,是 GPT 5.6 Sol 的近 9 倍 — Wonderful_Buffalo_32 · 2026-09-04
- OpenAI 官宣 GPT-6 Astra:电脑上能做的事它都能替你做 — minchoi · 2026-09-04
- Astra 官方 ARC-AGI 3 得分 62.7%,是 Opus 5 的两倍 — aqpstory · 2026-09-04
- 「GPT-6 Astra」宣称一周逐街重建曼哈顿 Unreal 世界,真伪存疑 — doodlestein · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04