分析 246 个仓库和 57 篇论文:agent harness 什么做法真有效
Marmelab · reddit · 2026-09-25
作者调研了 246 个开源仓库和 57 篇论文,总结 agent harness 工程中哪些是新兴最佳实践、哪些只是炒作。
核心结论:最好的 harness 都小而基于证据,并持续迭代。
有效做法:
- 自己写 harness(或让另一个人写):ETH Zurich 研究发现机器生成的上下文反而降低任务成功率,还把推理成本推高 20%;人类写的上下文成功率提升约 4%。
- 针对观察到的失败来构建 harness:现代 agent 本身已相当能干,harness 应补偿你实际见过的弱点。
- 限制暴露给 agent 的工具与技能:只在真有需要时加技能或子 agent。Vercel 砍掉 80% 工具后成功率从 80% 升到 100%,token 减半;微软把 100 个工具砍到 2 个。
- 一次只改一个组件并测量影响:否则不知道是哪个改动起了作用。
- 同时要有测试和 eval:AGENTS.md、hooks、脚本不会因为存在就生效,指令可能被直接忽略。
- 同时测「应该发生」和「不应该发生」的用例:只测必须拦截的用例,收紧护栏永远安全、放松则不可见,harness 会慢慢漂移成什么都拦、把 agent 掐死。单边 eval 导致单边优化。
「编程与Agent」频道最新
- Peter Yang 推出 25+ 课时的 AI 工作流课程 — lennysan · 2026-09-26
- cargo-atlas:基于编译器的 Rust 语义地图,供 MCP 编码智能体查询 — Ok_Manufacturer_5736 · 2026-09-26
- 开源 AI 播客剪辑器:克隆声音换主持人,一条链接产出完整节目 — LeviTurk · 2026-09-26
- 开源 WearScout:传一张穿搭照,浏览器智能体帮你跨店找同款 — HowDevelop · 2026-09-26
- 开发者撰文:RAG 无法替代一个好模型 — galratner · 2026-09-26
- 牙医说打不开的 800 张 DICOM 牙片,一条 prompt 让 Claude Code 做出查看器 — claudeai · 2026-09-26