构建优质 Eval 第 10 篇:不只测结果,更要测每个步骤
realmadhuguru · x · 2026-09-10
- 核心主张:agent 评测不能只看最终答案。两条轨迹可能都得出 42,但一条用 4 次干净的工具调用、检索到正确文档;另一条重复搜索 3 次、犯 2 次错、17 次调用才到达——孰优孰劣一目了然。
- 操作步骤:
- 清晰定义整个工作流;
- 定义每个步骤中的任务;
- 思考如何测量每一步——独立 eval 还是整体 eval 的切片;
- 定义中位难度与高难任务,并反映到 eval 中。
- 引用第 9 篇(Eval Roadmap 问题):多数 eval 失败是因为团队把它们当静态产物,而用户预期在演化。以金融研究 agent 为例:早期用户要总结 5 页财报,三周后要对比 5 份财报讲增长故事,两个月后要基于 15 份文件构建投资论点,最终要求监控持仓并在论点实质变化时告警——eval 需要随产品与真实用法共同演进的路线图。
「编程与Agent」频道最新
- 16 倍 MVP 直播实验:五工具+Markdown 打造个人知识型 Agent — dfinke · 2026-09-11
- 个人 AGI 实验直播:让 Agent 把你的工作变成可检索的知识库 — dfinke · 2026-09-11
- 开源工具 Maestro 用 25 个命令诊断 AI 编码工作流故障 — tom_doerr · 2026-09-11
- CMU 提出 TAHI 框架:让 AI 产出经得起专家署名的作品 — EchoShao8899 · 2026-09-11
- 用 GitHub Copilot App 一站式排障:从 WebSocket 报错到提交 PR — DanWahlin · 2026-09-11
- 开源 raggy:纯本地文档 RAG 命令行工具,混合检索加自动 OCR — paulknysh · 2026-09-10