FrontierSWE v2 发布:20 小时长程任务实测,Fable 5.1 领先超 24 个百分点

nrehiew_ · x · 2026-09-03

nrehiew 发布 FrontierSWE v2,在极难、极长程的任务上评测模型——模型需自主工作最长 20 小时。结果 Fable 5.1 以超过 24 个百分点的优势成为当前最佳模型。作者同时分享了长线程经验帖:模型在此类超长任务上的表现洞察与榨取性能的方法,包括自研 Proximus harness、submit 工具提醒时间预算、以及 reward hacking 防护与模型作弊案例。

所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →