Eval 工程入门:把「对」写下来让机器来判
Roger_M_Taylor · x · 2026-09-15
一篇系统讲解 eval engineering(评测工程)的长文:模型干活,但总得有人说「这是对的」——只要那个人是你,agent 就离不开你。Eval 工程就是把「对」写成机器能检查的标准,否则改个 prompt 或换个模型,你无法知道是否弄坏了什么。
核心方法论:
- 从失败案例入手:手动读 100 条真实失败运行,用自己的话写下错在哪再归类,通常 3-4 类失败就能覆盖大部分,且往往不是你预想的那些
- 通用 judge 不可靠:引用 Hamel Husain 的例子,一个评「有用性」的 judge 放过了把浴室连到错误位置的答案
- 两层检查:先代码后模型
该文配合 Vtrivedy10 团队发布的 Eval Engineering Skill——一个帮助编码 agent 基于代码库和 agent trace 自动构建评测的 skill。
「编程与Agent」频道最新
- 三个 MCP 接进一个编码 Agent:零经验也能让 AI 自动做游戏 — PurzBeats · 2026-09-15
- GPT-6 Astra + SWE-2 High 融合模式跑进 Devin,作者称效果惊人 — CtrlAltDwayne · 2026-09-15
- 用 Agent 跑技术团队成风,人类判断力仍无可替代? — infoxiao · 2026-09-15
- 12.9k 星的 Claude skill:自动写出精准 prompt,省掉反复重试 — tom_doerr · 2026-09-15
- 开源 Harness 让 OS World 2.0 成绩提升约 20%,从第四跳到第一 — demeyer1 · 2026-09-15
- 什么时候 MCP 是过度设计?开发者讨论 MCP 的适用边界 — JuicerSocial · 2026-09-15