Hamel Husain:通用评测指标大多弊大于利,应基于错误分析自建评估器
HamelHusain · x · 2026-10-07
- AI Evals 领域知名作者 Hamel Husain 在博客 FAQ 中回答「该不该用现成通用评测指标」:大多数情况下不该用。
- 论点:helpfulness、coherence 等通用分数衡量的是抽象维度,与你的具体用例无关,得分高不代表系统有效,反而制造虚假信心、浪费时间。
- 正确做法:做错误分析理解失败模式,基于真实问题定义二元失败类别,为其创建自定义评估器,并用人工判断校验。
- 有经验的从业者仍可将通用指标用作探索信号:在理解其局限后,用它筛出值得人工审查的 trace。
「编程与Agent」频道最新
- AI 一把过:用 Ghidra 逆向微软应用逆向出全新 Rust 版,作者称这就是盗版 — teropa · 2026-10-08
- ChatGPT 控制 Claude 控制 ChatGPT:作者晒出 AI 应用互相调用的套娃现场 — danshipper · 2026-10-08
- 《百页深度学习书》作者考虑再写一本 Python 动手版 Agentic Harness 小书 — burkov · 2026-10-08
- Every 放弃个人 Agent 转做共享公司 Agent,并开放给企业试用 — danshipper · 2026-10-08
- JPMorgan 研究员:AI 编码烂活泛滥,根因是用户对 Agent 太纵容 — JFPuget · 2026-10-08
- Agent 评测实操三步:录全程、人工标注、只用二元 fail 标签 — strickvl · 2026-10-08