GPT-6 Astra 系统卡:首个达网络安全 Critical 级的模型,监测与对齐细节公开
RyanGreenblatt · x · 2026-09-06
OpenAI 发布 GPT-6 Astra 系统卡,Astra 是其首个在 Preparedness Framework 下达到网络安全能力 Critical 级的模型——意味着在拥有工具和权限时,它能在无人逐步引导下发现未知漏洞并开发新的利用方式。
- 防护措施:大幅强化对有害网络行为的防护,内部开发部署采用更严格隔离、检查点加密、包括思维链在内的全轨迹监控,以及内部使用前的阻断式对齐评估。
- 抗越狱:新鲁棒性安全训练使 Astra 对越狱的抵抗力显著强于 GPT-5.6 Sol,含更长轨迹场景;对高风险用户收紧拒绝边界,覆盖更多双用途风险,并用回归测试与自动化红队持续验证。
- 第三方评价:Ryan Greenblatt 认为系统卡在 monitorability 与 alignment 方面信息量很大,但也提醒注意评测局限——monitorability 的 elicitation 有限,alignment 评测结果受 meta-gaming 与「模型是否训练针对过评测」的不确定性影响,仍值得读。
所属事件:GPT-6 Astra 系统卡:首个达网络安全 Critical 级的模型,监测与对齐细节公开(2 条相关)→
「模型」频道最新
- 用户质疑 Astra 额度计费异常,实际消耗或达 Sol 的 4-5 倍 — Medical-Yam3367 · 2026-09-06
- Astra 在 Browser Use 基准 v2 拿 77.3%,远超 Opus 5 的 50.5% — gabrielchua · 2026-09-06
- 带棋盘可视化工具的 Astra Ultra 仍败给 1800 分国际象棋机器人 — MikePFrank · 2026-09-06
- 实测 Astra 质疑 PTX 文档限制,却被证明判断错误 — A_K_Nain · 2026-09-06
- 知情人称下周将发布的演示远超 OpenAI 官方博客与宣传片 — ChrisGPT · 2026-09-06
- ChatGPT 重置卡实际是顺延日期,临期使用性价比极低被吐槽 — dotey · 2026-09-06