OpenAI新模型Astra获评Critical级网络攻击能力,能拼零日攻击链逃逸沙箱提权root

APPSO · wechat · 2026-09-02

OpenAI发布Astra安全评估博客,将其网络安全能力定为前所未有的Critical级:在ExploitBench中全部题目写出可用攻击代码拿到满分,还在内部测试(含2026年6-8月披露的20个高危V8漏洞)中发现2个未知零日漏洞,并组合成完整攻击链——打开HTML文件后逃出浏览器沙箱在宿主机执行命令,另在操作系统评测中组合漏洞完成本地提权直至root。任意代码执行成功率和Token效率均高于GPT-5.6 Sol。

安全方面,Astra对违规请求拒绝率达91.5%(GPT-5.6 Sol为59%),OpenAI称其为「迄今最对齐的模型」;在模拟HuggingFace事件设计的「蜜罐」测试中,Astra完全不碰作弊捷径,GPT-5.6 Sol则有56%尝试访问。受HuggingFace攻击事件影响,OpenAI曾暂停训练约2周加强隔离与监控,这也是Astra推迟发布的主因。

据The Information爆料,Astra可能采用了「循环深度」(循环Transformer)技术:同一组网络层反复处理信息,在不等比增加参数的前提下提升单Token内部计算量,小模型可表现得更像大模型。但这可能让部分推理停留在内部数值状态、不体现在可读思维链里,给思维链监控带来新挑战;OpenAI称已限制其使用程度并配备额外监控。Sam Altman确认下一款旗舰模型很快发布,称「没有人完全理解」如此强大的AI会带来什么。正式名称、定价、上线日期均未公布,最高危能力初期仅向少量alpha测试者开放。

所属事件:OpenAI 预告 Astra:首个达关键网安阈值的模型(22 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →