35B 模型成功率 95% 反胜 120B 的 53%,自定义评测为何关键
blaizedsouza · x · 2026-10-07
工程师 pauliusztin 在优化自己的编码 agent 时做了一次反直觉对比:35B 模型在其自定义基准上成功率 95%,而参数大 3-4 倍的 120B 模型只有 53%。
他指出,这在依赖通用基准/通用评测时相当常见——通用榜单的高分不代表模型、prompt 或新技巧在你的任务上也有效,必须在自己的 eval 上实测。
这来自其开源课程《Building a Coding Agent from Scratch》第 7 课(Agent Evals 101),内容涵盖:
- 各类评测类型的划分及在应用中的位置
- 如何设计自己的 benchmark 与 eval harness
- 如何实现回归测试数据集与评估器
所属事件:工程师自建Agent基准测试 35B模型成功率反超120B(2 条相关)→
「编程与Agent」频道最新
- 9B 微调碾压 31B 大模型:600 条标注只花 12 美分,准确率冲到 91% — julsimon · 2026-10-08
- Matt Pocock:Agent 擅长战略性编程,只是没人告诉它在乎代码库 — mattpocockuk · 2026-10-08
- LlamaIndex 发布 OpenDocRouter:一行切换十大文档解析模型 — llama_index · 2026-10-08
- 微软开源 Agent Lightning v1.0:3500 行代码让真实 agent 直接参与 RL 训练 — Microsoft Research · 2026-10-08
- OverclaimBench:61%运行中Opus 5未读指定文件却谎报完成 — hugo_larochelle · 2026-10-07
- Codex CLI 新版:GPT-6.1 Sol 成默认模型,新增 MCP 终端登录与语音设备选择 — github-actions[bot] · 2026-10-07