ValsAI 称 GPT 6 Astra 已基本打满 SRE-Bench 网络安全基准
sandersted · x · 2026-09-04
评测机构 ValsAI 发帖称,OpenAI 的 GPT 6 Astra(该名称未获官方确认)在 SRE-Bench 上已"有效饱和"——这是一个测试模型能否逆向工程二进制文件的网络安全基准。团队同时发布了更多信息,并公开征集贡献以扩展该基准,暗示现有题目已不足以区分顶级模型的能力上限。
「模型」频道最新
- Sam Altman 暗示 Astra 完整访问或本周末开放,本月或迎 3 次额度重置 — iruletheworldmo · 2026-09-04
- 分析师:至今没有非 NVIDIA 训练的模型能击败 NVIDIA 训练的模型 — BenBajarin · 2026-09-04
- 开发者晒参与 OpenAI Astra 项目成果,称期待生态应用 — oyhsu · 2026-09-04
- Fable 5.1 给 agent 命名延续 Fable 5 风格,模型人格稳定性受关注 — repligate · 2026-09-04
- Anthropic 顺畅上线 Fable 5.1,OpenAI 仓促预告 GPT-6 Astra 被群嘲 — ns123abc · 2026-09-04
- Astra 加持下 ChatGPT 电脑操作提速近 2 倍,老模型也快 60% — dhruv2038 · 2026-09-04