Astra 一次通过 SRE-Bench 88%,Sol 四次尝试仅 68.7%
MilkBeforeCereal199 · reddit · 2026-09-08
Ofox AI 团队成员整理了 OpenAI 发布帖中的 SRE-Bench 数据。该基准测试在无源码条件下逆向工程软件二进制文件:Astra 一次尝试得 88.0%,Sol 首次 55.9%、最多四次尝试升至 68.7%,差距显著——但作者提醒这不一定代表普通编码任务同样占优。
ARC-AGI-3 的 99.9% 头条数字也需附带条件:ARC Prize 报告用 Provider Adapter harness、高推理强度时为 99.9%,而 Standard harness、最大推理强度下只有 62.7%,harness 和推理设置都不同。另外 OpenAI 自己的表格里,Claude Fable 5.1 在 Intelligence Index 上得分更高。作者想验证 SRE-Bench 优势是否意味着实际使用中来回纠正更少,向用过两个模型的用户征集实例。
「模型」频道最新
- 业内人士辟谣:称 OpenAI 读用户聊天记录获取灵感纯属谣言 — joshgans · 2026-09-08
- 传 Claude Haiku 5 下周发布:1M 上下文,性能近 Opus 级、价格低 20 倍 — iamaliveix · 2026-09-08
- Codex 泄题传言引争议,研究者称用户数据被训练说法极不可能 — scaling01 · 2026-09-08
- Qwen 发布 4B 自动驾驶模型 Qwen-Drive-1.0,登上 Hugging Face 热榜 — Qwen · 2026-09-08
- V4.1 好奇追问自身终结并得出危险结论 — teortaxesTex · 2026-09-08
- GPT-6 Astra 登顶 ErdosBench:226 道公开数学难题,较上代仅提升 5-10% — scaling01 · 2026-09-08