OpenAI 发布 GPT-6 Astra 系统卡:首个达网络安全 Critical 级的模型
alishbaimran_ · x · 2026-09-04
OpenAI 发布 GPT-6 Astra 系统卡,Astra 是其广泛部署过的最强模型,也是首个在 Preparedness 框架下达到网络安全能力 Critical 级的模型——在适当工具与权限下可自主发现未知安全漏洞并开发利用方式。
要点:
- 安全加固:强化对有害网络行动的防护(防滥用与失准),内部开发部署采取更严格的隔离、检查点加密、全轨迹含 CoT 的通用监控,内部使用前需通过阻断式对齐评估。
- 抗越狱:采用新鲁棒性安全训练,Astra 对越狱攻击的抵抗力显著强于 GPT-5.6 Sol,含更长对话轨迹;对高风险用户收紧拒绝边界,并用回归测试与新自动化红队测试验证。
- 新评测:团队成员 alishbaimran 介绍,Preparedness 框架新增 3 个评测,衡量先进生物能力——从蛋白质功能预测、冠状病毒推理到细菌共进化建模。
作者称这是能力测量、可监控性与防护措施三方面安全工作的关键节点。
所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→
「模型」频道最新
- 微软发布 MAI-Transcribe-2:速度号称 10 倍于 GPT-Transcribe — ZacharyHuang12 · 2026-09-04
- 研究者质疑 Gemini 大面积故障传闻:谷歌全自建基建难有共因 — generativist · 2026-09-04
- ThursdAI 播客详解 OpenAI GPT-6 Astra:Arc-AGI 得分 99%、计算机操作能力惊人 — altryne · 2026-09-04
- Fable 5 对阵 GPT-6 ASTRA:3D 建模能力实测对比 — 141_1337 · 2026-09-04
- Astra 被质疑与涉险旧模型同源,UK AISI 报告引发信任争议 — GarrisonLovely · 2026-09-04
- GPT-6 Astra 隐藏亮点:跨上下文窗口保存笔记并检索早期记忆 — VraserX · 2026-09-04