OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9%
morqon · x · 2026-09-05
OpenAI 发布迄今最强模型 GPT-6 Astra 的系统卡,要点:
- 网络安全能力首达 Critical 级:这是 OpenAI Preparedness 框架下首个达到该级别的模型,配合适当工具可在无人逐步引导下发现未知安全漏洞并对多层防护系统开发新攻击方式。
- 内部防护升级:包括更严格的隔离、checkpoint 加密、对完整轨迹(含思维链 CoT)的全面监控、内部使用前的阻断式对齐评估。
- 越狱鲁棒性显著提升:采用新的鲁棒性安全训练技术,Astra 比 GPT-5.6 Sol 在更长轨迹上更能抵抗越狱,并有内外部红队测试、高风险用户的保守拒绝边界训练、回归测试与自动化红队机制。
- 引用讨论称 Astra 的 prompt injection 鲁棒性接近 99.9%,认为已接近向十亿用户部署 agent 的时机。
「模型」频道最新
- Alexandr Wang预告Muse Spark 1.3:推理等级可设至max — alexandr_wang · 2026-09-05
- Muse Spark 1.3 max 公开发布,编码与智能体性能显著提升 — jordihays · 2026-09-05
- Alexandr Wang 官宣 Muse Spark 1.3 max 发布,编码与智能体能力显著增强 — alexandr_wang · 2026-09-05
- Alexandr Wang 官宣发布 Muse Spark 1.3 Max,编码与 Agent 能力显著提升 — alexandr_wang · 2026-09-05
- GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升 — mhmazur · 2026-09-05
- Ling-3.0-flash-VL 发布:在 flash 基础上加入视觉理解与视觉 agent 能力 — niacolhealth · 2026-09-05