Evals 精华长文:多数 AI 团队先写指标,结果测错了东西

lennysan · x · 2026-09-23

Hamel Husain 与 Shreya Shankar 在 Lenny's Newsletter 发表进阶篇长文,基于服务 50+ 家 AI 公司的经验,讲解如何发现并修复产品中的隐藏 AI 失败。核心论点:多数团队直接跳到写指标,结果衡量了错误的东西;正确做法是先做 error discovery(错误发现),这是被最多团队跳过的环节。

文中给出实战案例数据:Ramp 把自动收据识别准确率从 35% 提到 83%;Shopify 的 AI workflow builder 比被替换的前沿模型方案快 2.2 倍、成本低 68%;Harvey 重建 AI 合同审查器后内部质量分接近翻倍;Cursor 调优 Auto Balance 路由后用户满意度更高、成本降 41%。

文章梳理了流程中哪些步骤可以自动化、哪些不能,并附一个免费插件让编码 agent 承担大部分重活;配套还有 30 分钟可读完的正文与可直接使用的 evals skills。作者指出近半数 AI PM 职位都要求 evals 经验,该技能价值持续上升。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →