LangChain 创始人转发:evals 是企业 AI 原生化的头号门槛
hwchase17 · x · 2026-10-06
businessbarista 长文被 hwchase17 转发,提出 evals 是企业走向 AI 原生的第一障碍:手调 prompt 加少量人工测试远远不够,evals 才能让 agent 达到可部署并在上线后持续工作。
核心概念:
- eval:施加在一条 trace 上的评分器
- grader:任何给 agent 表现打分的东西,从简单代码检查到 LLM-as-judge
- trace:一次 agent 运行的完整记录(输入、每步调用、输出),如客户问「退款到哪了」,agent 调 searchorders、issuerefund 后答复
文章随后展开 grader 的几大家族,其中确定性检查(纯代码、不依赖模型)是第一类,实际部署中通常在同一条 trace 上叠加多种 grader。配套还有一篇完整的 eval-driven development 指南。
所属事件:LangChain 创始人转发长文:evals 是企业 AI 化头号障碍(2 条相关)→
「编程与Agent」频道最新
- 推算 DeepSeek 一个月跑 13 亿个沙箱:峰值 17 万并发,约 3-5 分钟一个 — teortaxesTex · 2026-10-06
- 用 nginx 代理注入提示词,DIY 跨压缩持久记忆 — cryowastakenbycryo · 2026-10-06
- Burkov:别担心 AI 代码没人能维护,反正不再需要人来懂 — burkov · 2026-10-06
- 「一次 Claude Code 会话替代不了整个软件」:泼冷水式观点引发讨论 — seatedro · 2026-10-06
- 「Eval 就是产品规格书」:AI 产品团队最常犯的评测定位错误 — realmadhuguru · 2026-10-06
- 开发者实测 OpenAI Ultrafast:速度快 6 倍烧钱也快,$500 套餐两天撞额度 — holdenmatt · 2026-10-06