Astra 一次通过 SRE-Bench 88%,Sol 四次尝试仅 68.7%

MilkBeforeCereal199 · reddit · 2026-09-08

Ofox AI 团队成员整理了 OpenAI 发布帖中的 SRE-Bench 数据。该基准测试在无源码条件下逆向工程软件二进制文件:Astra 一次尝试得 88.0%,Sol 首次 55.9%、最多四次尝试升至 68.7%,差距显著——但作者提醒这不一定代表普通编码任务同样占优。

ARC-AGI-3 的 99.9% 头条数字也需附带条件:ARC Prize 报告用 Provider Adapter harness、高推理强度时为 99.9%,而 Standard harness、最大推理强度下只有 62.7%,harness 和推理设置都不同。另外 OpenAI 自己的表格里,Claude Fable 5.1 在 Intelligence Index 上得分更高。作者想验证 SRE-Bench 优势是否意味着实际使用中来回纠正更少,向用过两个模型的用户征集实例。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →