自动化评测实测:最佳系统找回 87% 人工标注故障
HamelHusain · x · 2026-09-19
Parlance Labs(Hamel Husain 等)发布研究《Do Automated Evals Work?》,对比人工错误分析与自动化评测系统(Braintrust Loop、Arize Alyx、LangSmith Engine 及通用编码 agent)。
- 实验设计:取自生产环境公寓租赁 AI 的 100 条 trace,先由领域专家人工标注故障,再隐藏标签让各系统独立找错,对比人机差异。
- 结果:表现最好的自动化系统找回了人工标注故障的 87%,且每个系统都发现了一些人类遗漏的问题。
- 局限:全自动方式始终抓不住那些「看起来正确但用户体验不佳」的交互失败。
- 作者建议:可以用 agent 辅助审阅,但人必须留在回路中;审阅大 trace 时应聚焦第一个上游失败,把相关证据整理得便于检查、按需展开。
- 文章还指出「criteria drift」现象:你需要标准才能给输出打分,但正是在打分过程中才发现标准,因此作者历来反对把评测完全外包给 LLM。
「编程与Agent」频道最新
- 开发者用 Jev + search1api 打造免费开源搜索工具 Jev Search — gaganghotra_ · 2026-09-19
- Llama 3 在线 RL 栈核心作者加入记忆层初创 Merrai 任顾问 — misovalko · 2026-09-19
- Braintrust 集成 Jev: typed 决策模型可替代 LLM-as-a-judge — multiply_matrix · 2026-09-19
- Chrome 官方框架:如何为 AI Agent 设计有效的 WebMCP 工具 — gaganghotra_ · 2026-09-19
- 实测 24 小时烧 $3.40:Jev 会与 LLM 融合而非取代 — gaganghotra_ · 2026-09-19
- 26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100% — ddkang · 2026-09-19