只改 harness 不换模型:deepagents-cli 在 Terminal-Bench 提升 13.7 个百分点

Gauri_the_great · x · 2026-09-07

作者观察 agent harness 与基础设施是一个活跃的工程领域:LangChain 在保持 GPT-5.2-Codex 不变的情况下,仅靠 harness 改造就把 deepagents-cli 在 Terminal-Bench 2.0 上的成绩从 52.8% 提到 66.5%,手段包括注入环境上下文、强制 build–verify–fix 循环、加入循环/超时守卫、按阶段分配推理预算。作者指出 agent 长时间运行时,checkpointing、沙箱、重试、工具权限、追踪与验证等机制决定任务成败,模型智能只是系统的一部分。结尾自嘲一句:反正 Fable 5.1 能一发完成整个任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →