Codex 与 Claude Code 会拖累长程任务表现,自研 harness 全面提分
nrehiew_ · x · 2026-09-03
作者发现,未针对长程任务设计的原生标准 harness(包括 Codex 和 Claude Code)会人为削弱模型表现,因此团队基于 mini-swe-agent 打造了自研 Proximus harness,在得分和模型持续工作时长上均取得全面提升。作者还指出长程任务可作为某种分布外评测的代理:当单个任务耗时 20 小时、消耗 2 亿 token 时,大规模后训练近乎不可行。
所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→
「编程与Agent」频道最新
- Linear 的自动修复循环 30 天修了 300+ bug:接入 Datadog/Sentry 交给编码 agent — zeeg · 2026-09-03
- 恶意 .git 配置可让 Claude Code 等 7 款 AI 编码代理执行攻击者代码 — Thionne_WTZ · 2026-09-03
- 独立开发者 marclou 全面转向 agent-first:新 SaaS 全配 MCP 与 API — marclou · 2026-09-03
- marclou 新 SaaS 全面 agent-first:60+ 工具的 MCP 让 AI 可操作全部 UI — steipete · 2026-09-03
- 开发者用1820万tokens让Fable 5.1端到端生成完整浏览器应用 — gaganghotra_ · 2026-09-03
- DeepMind 83页论文:自主科研agent 九成实验结论靠编造 — williamtp · 2026-09-03