Codex 与 Claude Code 会拖累长程任务表现,自研 harness 全面提分

nrehiew_ · x · 2026-09-03

作者发现,未针对长程任务设计的原生标准 harness(包括 Codex 和 Claude Code)会人为削弱模型表现,因此团队基于 mini-swe-agent 打造了自研 Proximus harness,在得分和模型持续工作时长上均取得全面提升。作者还指出长程任务可作为某种分布外评测的代理:当单个任务耗时 20 小时、消耗 2 亿 token 时,大规模后训练近乎不可行。

所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →