工程师自建Agent基准测试 35B模型成功率反超120B
工程师 pauliusztin 发布《Agent Evals 101: Stop Guessing, Start Measuring》,讲解如何为任意 agent 框架搭建自建基准测试。他在优化自己的编码 agent 时做了一次反直觉对比:35B 模型在自定义基准上成功率达 95%,而参数规模大 3-4 倍的 120B 模型仅有 53%。这一结果说明通用模型规模并不必然带来更好的 agent 表现,针对自身任务定制评测基准、用回归测试持续度量,比单纯堆参数更能指导模型选型。
2026-10-07 ~ 2026-10-07 · 2 条相关
- Agent Evals 101:用自建基准对 35B 与 120B 模型做回归测试 — blaizedsouza · 2026-10-07
- 35B 模型成功率 95% 反胜 120B 的 53%,自定义评测为何关键 — blaizedsouza · 2026-10-07