Agent Evals 101:用自建基准对 35B 与 120B 模型做回归测试

blaizedsouza · x · 2026-10-07

作者 pauliusztin 发布《Agent Evals 101: Stop Guessing, Start Measuring》,讲解如何为任意 agent 框架搭建基准测试与回归测试体系。

文中以自己的编码 agent 为例:在自定义 benchmark 上对比 35B 与 120B 两个模型,120B 虽大 3-4 倍,但结果未必如预期——说明 agent 性能不能靠直觉判断,必须量化测量。

核心主张:停止猜测、开始测量,用可复现的评测流程对 agent 改动做回归测试,避免优化时引入隐性退化。

所属事件:工程师自建Agent基准测试 35B模型成功率反超120B(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →