CMU 博客:Harness 工程不重训模型也能大幅提升科学 agent
niloofar_mire · x · 2026-10-03
CMU Looni Lab 团队(Suresh Raghu、Kevin Han、Aviral Kumar、Niloofar Mireshghallah)发布博客,系统探讨 agent harness(模型周围的接口层:工具、状态、表示)的设计问题。
核心观点:
- Harness 工程可以在不重训模型的情况下显著提升 agent,且部分设计过程正在被自动化。
- 编码 agent 的 harness 组件可跨项目复用,但科学 agent 往往需要围绕特定领域与工具定制的接口,使哪些部分可复用/自动化变得不那么显然。
- 在 SMDD-Bench(药物设计任务:先导优化、骨架跳跃、作用点识别)上的答案因任务而异:自动搜索能成功精炼工作流并发现有用的科学启发式,而最强的人工改进来自改变模型能观察到什么证据、环境保存什么状态。
- 博客附带 Prime Environment 与 Harbor 数据集链接。
所属事件:CMU 博客探讨 agent harness 自动搜索与人工调优之争(2 条相关)→
「编程与Agent」频道最新
- 开发者发布 Claude Code 插件:粘贴图片直接显示缩略图 — jarrodwatts · 2026-10-03
- Coinbase 推出 Agents 交易套件:新增 TWAP 等订单并可让智能体自动报修 — kleffew94 · 2026-10-03
- PhantomEnvironments 开源:7B 模型经合成 RL 环境训练战平 10 倍体量 agent — CShorten30 · 2026-10-03
- OpenAI 介绍 dot:跨应用记忆上下文、协调 Codex 任务 — OpenAIDevs · 2026-10-03
- MIT交互式图解:从Attention到Mixtral、DeepSeek-V3架构 — vtabbott_ · 2026-10-03
- 「让网站可被 Agent 走通」:AAA 协议给站点加 Agent 握手层 — sierracatalina · 2026-10-03