FrontierSWE v2 拉开 24 分差距:Claude Fable 5.1 得 56%,GPT-5.6 仅 32%
geoffwolfe · x · 2026-09-20
ReasonCoreAI 发布 FrontierSWE v2 基准,在表面接近的模型之间拉开 24.1 分的巨大差距:Claude Fable 5.1 得分 56.29%,GPT-5.6 仅 32.2%。
该基准使用 34 个超长时程任务,单个任务最长可达 20 小时,并配有让 agent 持续工作而非提前提交的 harness。作者的核心论点是:长时程能力是「任务设计 + harness」问题,而不是一次性编码得分能衡量的。该公司还在科学计算、研究与工程领域储备了 FrontierSWE 风格的任务集。
「模型」频道最新
- 评测者称纯代码启发式策略可在 Craftax 上胜过大模型 — JoshPurtell · 2026-09-20
- OpenAI Codex 全员重置已生效,官方预告周二有大发布 — kimmonismus · 2026-09-20
- Jev 做 PR 审查比 GPT-5.6 Luna 快 1.93 倍,单次仅 $0.0014 — aniketmaurya · 2026-09-20
- 果蝇连接组国际象棋模型击败 Jev,Labonne 再战一个 — maximelabonne · 2026-09-20
- Bonsai 2 27B 安全护栏砍掉近 20 分,SWE-bench 与 Terminal-bench 成绩大缩水 — julianharris · 2026-09-20
- 小米 MiMo-V2.6 直播 RL 训练:每步 20 亿 token,斯坦福 Marin 同步直播预训练 — stanfordnlp · 2026-09-20