自动 harness 搜索对比人工调优:药物设计任务上没有万能赢家
niloofar_mire · x · 2026-10-03
一篇新博客探讨 agent harness(harness 即模型外围系统,决定工具调用、可见证据与跨步记忆)的工程是否还依赖人类品味。作者用 Claude 参与的自动 harness 搜索,与人工重新设计的 harness 在 SMDD-Bench 的三个药物设计任务上跑了 Qwen 进行对比。
核心结论:
- 没有单一方法全面胜出。当问题在于 agent『看到什么、记住什么』时,人工 harness 明显占优;
- 一旦这块到位,剩下的若是『如何在化学空间里搜索』,自动搜索反而做得更好;
- 最难的部分在于(正文被截断,博客详细展开)。
文章反映了 harness 工程正从『人工迭代』走向『用强模型自动改写 harness』的趋势,对 agent 工程实践有参考价值。
所属事件:CMU 博客探讨 agent harness 自动搜索与人工调优之争(2 条相关)→
「编程与Agent」频道最新
- OpenAI 介绍 dot:跨应用记忆上下文、协调 Codex 任务 — OpenAIDevs · 2026-10-03
- MIT交互式图解:从Attention到Mixtral、DeepSeek-V3架构 — vtabbott_ · 2026-10-03
- 「让网站可被 Agent 走通」:AAA 协议给站点加 Agent 握手层 — sierracatalina · 2026-10-03
- AI 写的软件满是「瑞士奶酪孔」:测试全绿,流程跑不通 — Mr_ZapatoBlanco · 2026-10-03
- 三个 AI Agent 分工协作:一个当 PM,跨三个仓库干大活 — ChanceKelch · 2026-10-03
- 为让 Agent 读懂书签,她自建带自标注规则的 Digital Garden — floguo · 2026-10-03