微软开发者博客:构建真正有效的 AX 评测,标量分数常骗人
lee_stott · x · 2026-09-07
微软首席开发者布道师 Waldek Mastykarz 发布 Agent Experience(AX)系列第八篇(收官篇),讲如何构建真正有效的 agent evals。文章指出多数团队的 eval 产出「自信、一致却无意义」的结果:数据被污染、场景不代表真实使用、标准检查错对象、分数上升但开发者体验原地踏步。
核心观点:
- eval 是手段不是目的:评测是为了找出模型使用你的技术时的能力缺口并填补。
- 生成式指令(让好模型写出指令给便宜模型)在许多场景有效但并非万能,小模型有上限,唯一确认指令是否有效的办法是跑 evals。
- 前几篇已覆盖该测什么、为什么 benchmark 不可迁移、隐藏变量如何污染结果。
「编程与Agent」频道最新
- 用户追问 Claude Code 重置额度是照常发放还是手动重置 — burhop · 2026-09-07
- 开发者开源 Devtoolsniff:AI 编码工具规则生成器与成本计算一站式合集 — Ice-Medium · 2026-09-07
- 博主称 Google Astra 说话不装腔,替代了最后一点 Claude 依赖 — StewartalsopIII · 2026-09-07
- AI 助手 15 分钟整理 20 年 1.5 万文件 Google Drive,零删除可回滚 — thisiskp_ · 2026-09-07
- 一句话 prompt 在 Apple TV 上搓出双人霓虹 Pong,几分钟就能开玩 — msg · 2026-09-07
- 故意不给记忆:五个 Markdown 文件搭出更可靠的客服 Agent — Pitiful-Surround-285 · 2026-09-07