Evals 精华长文:多数 AI 团队先写指标,结果测错了东西
lennysan · x · 2026-09-23
Hamel Husain 与 Shreya Shankar 在 Lenny's Newsletter 发表进阶篇长文,基于服务 50+ 家 AI 公司的经验,讲解如何发现并修复产品中的隐藏 AI 失败。核心论点:多数团队直接跳到写指标,结果衡量了错误的东西;正确做法是先做 error discovery(错误发现),这是被最多团队跳过的环节。
文中给出实战案例数据:Ramp 把自动收据识别准确率从 35% 提到 83%;Shopify 的 AI workflow builder 比被替换的前沿模型方案快 2.2 倍、成本低 68%;Harvey 重建 AI 合同审查器后内部质量分接近翻倍;Cursor 调优 Auto Balance 路由后用户满意度更高、成本降 41%。
文章梳理了流程中哪些步骤可以自动化、哪些不能,并附一个免费插件让编码 agent 承担大部分重活;配套还有 30 分钟可读完的正文与可直接使用的 evals skills。作者指出近半数 AI PM 职位都要求 evals 经验,该技能价值持续上升。
「编程与Agent」频道最新
- DigitalOcean 推出 Managed Agents 公测:闲置自动暂停,一站式计费 — SimplyAnnisa · 2026-09-23
- qBotica 从 3 人做到营收增长 335%:服务交付软件化的创始人访谈 — rschmelzer · 2026-09-23
- X 高管:agent 蜂群将淹没网站,机器人检测是急需的市场空白 — PTrubey · 2026-09-23
- 一句提示词技巧:让 AI「拿出你已修复的不可抗拒证据」 — jobergum · 2026-09-23
- Stripe 自研 AI 原型工具 Harbor,5 个月产出 1.2 万个原型 — dl_weekly · 2026-09-23
- Zvi 读 Opus 5.5 系统卡:失败模式多可提示词与 harness 规避 — TheZvi · 2026-09-23