别只跑 Evals:微基准测试帮你定位 AI 系统哪个组件在退化

arpit_bhayani · x · 2026-10-08

Arpit Bhayani 提出在端到端 evals 之外,还应为 AI 系统建立微基准测试(microbenchmark):对系统中单个小环节在受控条件下反复运行,得到稳定可比的信号。

可微基准测试的对象不限于模型本身,例如:

核心论点:端到端 eval 只能告诉你系统整体是否变好,当整体延迟变化不大时很难定位是哪个组件出了问题;而微基准给出单组件信号,让回归(regression)更容易发现和排查。他强调两者不是替代关系——evals 告诉你系统有没有变好,微基准帮你搞清为什么。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →