CMU 博客探讨 agent harness 自动搜索与人工调优之争

CMU Looni Lab 团队发布博客,系统探讨 agent harness(决定工具调用、可见证据与跨步记忆的模型外围系统)的工程是否仍依赖人类品味。作者用 Claude 参与的自动 harness 搜索与人工调优在药物设计任务上对比,发现两种方法各有优劣,没有万能赢家,但结论是不重训模型也能通过 harness 工程大幅提升科学 agent 表现。

2026-10-03 ~ 2026-10-03 · 2 条相关