Astra 刷爆 ExploitBench 百分百胜率,达网安临界能力
infoxiao · x · 2026-09-02
Astra 模型在 ExploitBench 测试中取得 100% 成功率。为测试真实性,团队用模型知识截止日期后的新漏洞构建了内部刷新基准,结果显示 Astra 仍显著强于 GPT-5.6 Sol 且消耗更少 token。结合其他证据,团队认为 Astra 已达到“网安临界”能力阈值。
所属事件:OpenAI Astra 在漏洞利用基准大幅超越 GPT-5.6(3 条相关)→
「模型」频道最新
- Grok 图像生成翻车:预测学生毕业摆摊 — burkov · 2026-09-02
- 实测 Claude 5.1:编码最强且像正常人 — danshipper · 2026-09-02
- claude-fable-5 第三方报价 3.6 折:输入 3.6 美元输出 18 美元 — const_reborn · 2026-09-02
- Tokenomics 101:从三种种计费方式看 AI 时代的 token 经济账 — Aizkmusic · 2026-09-02
- Fable 5.1 初测:高定价牺牲优化,转向生物等复杂任务 — Aizkmusic · 2026-09-02
- Anthropic 被指忽略中欧美开源模型 — himanshustwts · 2026-09-02