Eval 是需求文档不是目标清单,AI 功能还需「完成的定义」
rseroter · x · 2026-09-09
Jeff Gothelf 撰文指出:eval 是需求文档、是你的「完成定义」,证明系统按预期运行,但不能告诉你做的是不是对的东西。
- Albertsons 案例:这家美国连锁超市 2026 年 8 月向《华尔街日报》披露,使用 AI 购物助手的用户消费高 10%,用完整版助手则高最多 26%——因为用户「不忘买牛奶」。但这是用户行为而非系统能力,eval 测不出这一点。
- 「Eval 是新 PRD」共识:Braintrust 的 Ameya Bhatawdekar 与 Mind the Product 的 Lisa Murkin 先后发文,OpenAI CPO Kevin Weil 也称「写 eval 是 AI 时代 PM 最重要的事」。因为产出随用户、prompt、模型而变,传统 PRD 事先写准需求几乎不可能。
- 核心论点:eval 聚焦系统行为(答案准确、合规、符合品牌),而人类行为层面的结果(如不忘买东西)需要产品定义「完成」的另一套标准,二者不能互相替代。
「漫话AGI」频道最新
- 数学教授吐槽 Anandkumar 在纳维-斯托克斯推文下刷屏 — suchenzang · 2026-09-09
- OpenAI 解 Navier-Stokes 疑因听说"有人做到过"才尝试 — kohjingyu · 2026-09-09
- 研究者观点:人类失对齐案例是对齐科学的宝贵经验数据 — kellerjordan0 · 2026-09-09
- Ben Fielding:当前 AI 只自动化知识工作,下一个时代属于决策优势与世界模型 — benfielding · 2026-09-09
- 投资者集体问 AI 同样的问题,催生同质化选股与暴跌连锁 — toptickcrypto · 2026-09-09
- Metaculus 首个 AGI 问题判定达标,预测者称一个时代结束 — AndyMasley · 2026-09-09