Snorkel AI 认为 Agent 评测该从生产 trace 重建
AI Engineer · youtube · 2026-07-25
Snorkel AI 的 Rustem Feyzkhanov 认为,Agent 评测不该只盯着公共基准,而要转向基于真实生产 trace 的私有仿真环境。
- 先从线上 trace 出发,把 agent 访问过的数据库状态、文件和工具全部还原,这样任务就能在相同条件下重放。
- 公共 benchmark 只能给一个成功率,但企业真正关心的是 每个任务的成本、延迟,以及 agent 是否遵守了内部策略。
- 评测环境应尽量复用生产中的同一套 skills、tools 和 evaluators,才能把不同模型放到同一口径下比较。
- 对长链路、多步骤任务,做法是:verifier 读最终状态,LLM judge 检查是否违规;一旦明显跑偏就提前停止。
- 难点包括:agent 的 reward hacking、缺失 fixture、以及本来就不可解的任务。
- 他的结论是:这种私有 benchmark 会像测试代码一样,成为 agent 的 CI/运维闭环,并且必须随着 agent 演进持续更新。
「编程与Agent」频道最新
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11