FrontierSWE v2 拉开 24 分差距:Claude Fable 5.1 得 56%,GPT-5.6 仅 32%

geoffwolfe · x · 2026-09-20

ReasonCoreAI 发布 FrontierSWE v2 基准,在表面接近的模型之间拉开 24.1 分的巨大差距:Claude Fable 5.1 得分 56.29%,GPT-5.6 仅 32.2%。

该基准使用 34 个超长时程任务,单个任务最长可达 20 小时,并配有让 agent 持续工作而非提前提交的 harness。作者的核心论点是:长时程能力是「任务设计 + harness」问题,而不是一次性编码得分能衡量的。该公司还在科学计算、研究与工程领域储备了 FrontierSWE 风格的任务集。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →