Agent=模型+Harness,评测应成 Harness 一等公民组件
hugobowne · x · 2026-09-08
Hugo Bowne-Anderson 转发 Vanishing Gradients 的客座文章,作者 Antaripa Saha(Quotient AI)结合 Hamel Husain 与 Shreya Shankar 的 AI Evals 课程经验,主张评测应是 harness 的一等公民组件。
核心观点:
- Agent = Model + Harness:模型提供能力,harness 通过工具、状态、记忆、执行环境、约束与反馈把能力转化为实际工作。
- 大多数 harness 讨论聚焦让 agent 能「行动」的部分(工具、文件系统、终端、沙箱),但最被忽视的是反馈——它决定这些能力到底是在帮忙还是徒增复杂度。
- Evals 是判断工具、记忆、权限、上下文等任何改动是否真正让系统变好的唯一手段,因此应纳入 harness 工程核心。
- 文章给出从 traces 到失败模式、领域特定标准、验证过的 judge 的工作流。
「编程与Agent」频道最新
- 开源 Agent Skills 打包独立游戏营销全流程:从选品到发售日运营 — NathanpmYoung · 2026-09-08
- GPT Astra 看图建 Blender 地牢,再用 MiniMax H3 生成穿越视频 — Hailuo_AI · 2026-09-08
- 用 GPT-6 Astra 造 3D 网站,人形机器人解剖成 1168 个 CAD 部件 — freelerobot · 2026-09-08
- Netflix 详解如何在生产规模构建、对齐并监控 LLM 裁判 — AxSaucedo · 2026-09-08
- 用两个 Python 脚本搞定视频剪辑,跳过 DaVinci 界面操作 — _AustinCalvert_ · 2026-09-08
- 开源 embedflow 零停机迁移嵌入模型,省去上亿文档重嵌入 — Potential_Low_1183 · 2026-09-08