分析 246 个仓库和 57 篇论文:什么样的 agent harness 真的有效
Marmelab · reddit · 2026-09-25
作者为搞清 agent harness(约束、引导模型的外层工程)的最佳实践,分析了 246 个开源仓库和 57 篇论文(聚焦编码场景),结论是:最好的 harness 小巧、基于证据、持续迭代。
- harness 要人写,别让 agent 写:苏黎世联邦理工研究发现,机器生成的上下文反而比不给上下文降低任务成功率,还多花 20% 推理成本;人写的上下文提升约 4% 成功率。
- 针对实际观察到的失败来建:现代模型已经很强,harness 应补真实短板。
- 限制暴露给 agent 的工具:Vercel 砍掉 80% 工具后成功率从 80% 升到 100%,token 减半;微软把 100 个工具砍到 2 个。
- 一次只改一个组件并量化影响,否则不知道哪项改动有效。
- 测试和 eval 都要有:AGENTS.md、hooks、脚本可能被模型直接忽略,别假设写了就生效。
- 正反用例都要测:只测「必须拦截」会让 harness 逐渐收紧、最终扼死 agent;单边优化是作者亲身踩过的坑。
所属事件:分析 246 个仓库与 57 篇论文:有效的 agent harness 小而克制(2 条相关)→
「编程与Agent」频道最新
- theo:模型路由器无法仅凭 prompt 判断任务复杂度 — nbaschez · 2026-09-26
- 20 分钟花 40 美元,Opus 5.5 写代码做出完整创业公司宣传片 — cedric_chee · 2026-09-26
- GitHub 联创坐镇的 OpenClaw 2.0 黑客松开赛:冠军飞 SF,奖品两台 Mac mini — steipete · 2026-09-26
- Opus 5.5 五分钟生成像素猫动画,作者公开完整 Prompt — majidmanzarpour · 2026-09-26
- 多人用 Opus 5.5 代码绘制像素动画,作者计划改成游戏 — majidmanzarpour · 2026-09-26
- Agent Flow 插件:在侧边栏实时可视化 Claude Code 全部子代理 — EricBuess · 2026-09-26