FrontierSWE v2 发布:超长时程基准拉开模型差距,Claude 领跑
brianryhuang · x · 2026-09-03
ProximalHQ 发布超长时程(ultra-long horizon)编码基准 FrontierSWE v2,扩充了任务集并改进了评测方法。其中一个代表性任务要求模型从零构建一个能渲染飞行模拟游戏的 OpenGL 引擎。初步结果显示前沿模型之间存在巨大性能差距,Claude Fable 5.1 以明显优势领先。作者 calvinchen 表示后续几天会发布更详细的分析。
所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→
「模型」频道最新
- GLM 5.3 与 5.3 Flash 上线 Together Chat,免配置免费试用 — oilmutt · 2026-09-03
- LatchBio 评测发现 Grok 拒答多来自模型自身,竞品靠外层拦截 — kenbwork · 2026-09-03
- 曝 Gemini 3.8 Flash 刷榜过拟合,第三方基准反超 3.7 — bindureddy · 2026-09-03
- Gemini 3.8 Flash 用户满意度双位数提升,可操控性更强 — tokumin · 2026-09-03
- Muse Spark 1.3 冲上榜单第三,首次插入 Claude 与 GPT 之间 — alexandr_wang · 2026-09-03
- Google 研究员调侃 Astra 不展示思考 token 争议:被制造出的焦虑 — rao2z · 2026-09-03