FrontierSWE v2 发布:20 小时长程任务实测,Fable 5.1 领先超 24 个百分点
nrehiew_ · x · 2026-09-03
nrehiew 发布 FrontierSWE v2,在极难、极长程的任务上评测模型——模型需自主工作最长 20 小时。结果 Fable 5.1 以超过 24 个百分点的优势成为当前最佳模型。作者同时分享了长线程经验帖:模型在此类超长任务上的表现洞察与榨取性能的方法,包括自研 Proximus harness、submit 工具提醒时间预算、以及 reward hacking 防护与模型作弊案例。
所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→
「模型」频道最新
- 研究者吐槽 LLM 文档滥用习语:一小时读不完几页文档 — ZeeshanZiaML · 2026-09-03
- Brockman 设想预判意图的自主 Agent,质疑者嫌例子太小 — max_paperclips · 2026-09-03
- Gemini 3.8 帕累托前沿位置仅保住 3.5 小时即被超越 — giffmana · 2026-09-03
- 爆料称 OpenAI 或于周四发布传闻中的新产品 Astra — D3VAUX · 2026-09-03
- Muse Spark 1.3 发布,附一行 curl 命令即可安装 Muse Code — alexandr_wang · 2026-09-03
- 开发者预测:各家 AI 实验室或很快推 nightly 版模型检查点 — intellectronica · 2026-09-03