别一次改所有变量:五步 Harness 工程法让 Agent 优化可测量
MaryamMiradi · x · 2026-09-16
多数人优化 AI Agent 靠一次改一堆东西然后碰运气。Maryam Miradi 主张为 Agent 建一套测试 harness,把改进变成工程问题,五步循环逐一测试:
- Parser
- Retriever
- 决策架构
- 模型
- 上下文配置
每次实验只改一个变量、其余保持不变,跑同一组测试用例,追踪整条流水线,将质量、成本、延迟、grounding 和通过率与基线对比。Harness 的价值不只是告诉你最终答案错没错,而是定位哪里坏了、衡量改动是否有效、在上线前抓住回归。她称 20 分钟就能搭出这样的测试 harness。
所属事件:Harness 工程兴起:让 AI Agent 改进可测量(4 条相关)→
「编程与Agent」频道最新
- MIT CSAIL 孵化 G5 Labs 出 stealth,1400 万美元做「后开发者」软件 — tim_kraska · 2026-09-16
- 踩坑总结:与编码智能体高效协作的 7 条真相 — PawelHuryn · 2026-09-16
- 一年 agentic coding 后他承认传统艺术家骂对了:代码里没有灵魂 — ryunuck · 2026-09-16
- Elyx 发布:面向设计工程师与 AI Agent 的集成设计环境 — dscape · 2026-09-16
- 多智能体并行为何烧钱:协调税与验证 token 的隐性成本 — pvncher · 2026-09-16
- Prior Labs 发布表格基础模型 TabPFN-3.5,可处理百万行数据登顶基准 — tuanacelik · 2026-09-16