35B 模型成功率 95% 反胜 120B 的 53%,自定义评测为何关键

blaizedsouza · x · 2026-10-07

工程师 pauliusztin 在优化自己的编码 agent 时做了一次反直觉对比:35B 模型在其自定义基准上成功率 95%,而参数大 3-4 倍的 120B 模型只有 53%。

他指出,这在依赖通用基准/通用评测时相当常见——通用榜单的高分不代表模型、prompt 或新技巧在你的任务上也有效,必须在自己的 eval 上实测。

这来自其开源课程《Building a Coding Agent from Scratch》第 7 课(Agent Evals 101),内容涵盖:

所属事件:工程师自建Agent基准测试 35B模型成功率反超120B(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →