自动 harness 搜索对比人工调优:药物设计任务上没有万能赢家

niloofar_mire · x · 2026-10-03

一篇新博客探讨 agent harness(harness 即模型外围系统,决定工具调用、可见证据与跨步记忆)的工程是否还依赖人类品味。作者用 Claude 参与的自动 harness 搜索,与人工重新设计的 harness 在 SMDD-Bench 的三个药物设计任务上跑了 Qwen 进行对比。

核心结论:

文章反映了 harness 工程正从『人工迭代』走向『用强模型自动改写 harness』的趋势,对 agent 工程实践有参考价值。

所属事件:CMU 博客探讨 agent harness 自动搜索与人工调优之争(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →