GPT-6 Astra 网络攻防能力首达 Critical 级,安全措施大幅升级
seanjtaylor · x · 2026-09-04
OpenAI 发布 GPT-6 Astra 系统卡,披露多项关键信息:
- Critical 级网络能力:Astra 是 OpenAI 部署过的最强模型,也是首个在 Preparedness Framework 下达到网络安全 Critical 级别的模型——配合工具与权限,它能无人逐步引导地发现未知漏洞并在防护严密的系统中开发新攻击方式。
- 安全加固:针对滥用与错位风险大幅强化防护,包括内部开发部署的更严格隔离、checkpoint 加密、对含思维链的全轨迹通用监控、以及内部使用前的阻断式对齐评估。
- 抗越狱:采用新的鲁棒性安全训练,Astra 对越狱攻击的抵抗力显著强于 GPT-5.6 Sol,包括更长轨迹场景;对高风险用户收紧拒答边界,并通过回归测试与自动化红队持续验证。
作者评论称我们正在快速消灭幻觉,且该评测真实反映用户体验而非学术跑分。
所属事件:GPT-6 Astra 系统卡发布:能力跃升但可监控性显著下降(37 条相关)→
「模型」频道最新
- Matt Shumer 实测 GPT-6 Astra:首个敢放手让它用电脑的模型 — mattshumer_ · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- Qwen 3.8 27B 对比 3.6:质量升 8%,耗时却长 5 倍 — DerTomsn · 2026-09-04
- 爆料称 GPT-6 Astra 用超 10 万张 GPU 训练,规模创 OpenAI 纪录 — BLUECOW009 · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型获正名,但离 AGI 还远 — Gary Marcus · 2026-09-04
- 用户质疑额度消耗异常,官方称 KV cache 一直开启、正扩容缓存命中 — arthurcolle · 2026-09-04