只改 harness 不换模型:deepagents-cli 在 Terminal-Bench 提升 13.7 个百分点
Gauri_the_great · x · 2026-09-07
作者观察 agent harness 与基础设施是一个活跃的工程领域:LangChain 在保持 GPT-5.2-Codex 不变的情况下,仅靠 harness 改造就把 deepagents-cli 在 Terminal-Bench 2.0 上的成绩从 52.8% 提到 66.5%,手段包括注入环境上下文、强制 build–verify–fix 循环、加入循环/超时守卫、按阶段分配推理预算。作者指出 agent 长时间运行时,checkpointing、沙箱、重试、工具权限、追踪与验证等机制决定任务成败,模型智能只是系统的一部分。结尾自嘲一句:反正 Fable 5.1 能一发完成整个任务。
「编程与Agent」频道最新
- Astra 引爆 AI-CAD:周末涌现大批 3D 建模示范,工程软件格局或重估 — burhop · 2026-09-07
- OpenAI 内部数据:32 小时级 agent 任务成功者超八成需人工介入 — DataLearnerAI · 2026-09-07
- threepointone:UX 重深度约束,Agent 体验重在拓宽执行空间 — threepointone · 2026-09-07
- dhh 花 20 美分用 Muse Code 完美完成整站框架迁移 — alexandr_wang · 2026-09-07
- 微软开发者博客:构建真正有效的 AX 评测,标量分数常骗人 — lee_stott · 2026-09-07
- UMass AutoIndex 把分块索引交给 AI 写代码,每条假设须验证提升 — CShorten30 · 2026-09-07