Agent Evals 101:用自建基准对 35B 与 120B 模型做回归测试
blaizedsouza · x · 2026-10-07
作者 pauliusztin 发布《Agent Evals 101: Stop Guessing, Start Measuring》,讲解如何为任意 agent 框架搭建基准测试与回归测试体系。
文中以自己的编码 agent 为例:在自定义 benchmark 上对比 35B 与 120B 两个模型,120B 虽大 3-4 倍,但结果未必如预期——说明 agent 性能不能靠直觉判断,必须量化测量。
核心主张:停止猜测、开始测量,用可复现的评测流程对 agent 改动做回归测试,避免优化时引入隐性退化。
所属事件:工程师自建Agent基准测试 35B模型成功率反超120B(2 条相关)→
「编程与Agent」频道最新
- AISI 开源 Transect:把 agent 交互记录变成可交互时间线 — joshua_saxe · 2026-10-07
- agent 说做完了不等于能上线:测试通过只覆盖一小部分就绪 — Glittering-Glass6135 · 2026-10-07
- 用 changelog prompt 让 Grok Bot 长期任务自动跟进自身更新 — RachelVT42 · 2026-10-07
- H3 Inpainting + LTX Matte LoRA 视频换背景工作流,效果惊艳 — linoy_tsaban · 2026-10-07
- Tokio作者打造的Rust ORM Toasty全面支持Turso数据库 — glcst · 2026-10-07
- DHH 称 AI 时代 Rust 将无处不在,Tokio 作者正在造 Rust 的 Rails — glcst · 2026-10-07