Snorkel AI 认为 Agent 评测该从生产 trace 重建
AI Engineer · youtube · 2026-07-25
Snorkel AI 的 Rustem Feyzkhanov 认为,Agent 评测不该只盯着公共基准,而要转向基于真实生产 trace 的私有仿真环境。
- 先从线上 trace 出发,把 agent 访问过的数据库状态、文件和工具全部还原,这样任务就能在相同条件下重放。
- 公共 benchmark 只能给一个成功率,但企业真正关心的是 每个任务的成本、延迟,以及 agent 是否遵守了内部策略。
- 评测环境应尽量复用生产中的同一套 skills、tools 和 evaluators,才能把不同模型放到同一口径下比较。
- 对长链路、多步骤任务,做法是:verifier 读最终状态,LLM judge 检查是否违规;一旦明显跑偏就提前停止。
- 难点包括:agent 的 reward hacking、缺失 fixture、以及本来就不可解的任务。
- 他的结论是:这种私有 benchmark 会像测试代码一样,成为 agent 的 CI/运维闭环,并且必须随着 agent 演进持续更新。
「编程与Agent」频道最新
- Andrew Ng发布免费一小时课程,讲Agentic知识图谱 — goyalshaliniuk · 2026-07-25
- Databricks称Genie Code在401个真实任务上胜出且每题仅0.55美元 — DbrxMosaicAI · 2026-07-25
- Claude Code 新增去 AI 味写作 skill,能改稿也能检测 — aigclink · 2026-07-25
- 字节与莫纳什论文把任务经验蒸馏进软件代理权重 — imjustnewatai · 2026-07-25
- 面向编程工作流的多智能体编排提示词 — doodlestein · 2026-07-25
- ChatGPT Cowork 加入虚拟机,专门测试复现实验材料 — RobbWiller · 2026-07-25