FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点

ProximalHQ 团队(nrehiew 等)于 9 月 3 日发布超长时程编码基准 FrontierSWE v2:模型需在极难、极长程的任务上自主工作最长 20 小时,代表任务包括从零构建一个能渲染飞行模拟游戏的 OpenGL 引擎。结果显示 Fable 5.1 以超过 24 个百分点的优势成为当前最佳模型。

已确认

为什么重要

该基准把评测时长推向小时级乃至 20 小时量级,暴露了主流 agent harness 与模型时间感知的短板,也为衡量长程自主能力与泛化能力提供了一个难以通过针对性训练「刷分」的参考框架。

2026-09-03 ~ 2026-09-03 · 5 条相关

事件全程(共 2 集)→

一手来源