别只跑 Evals:微基准测试帮你定位 AI 系统哪个组件在退化
arpit_bhayani · x · 2026-10-08
Arpit Bhayani 提出在端到端 evals 之外,还应为 AI 系统建立微基准测试(microbenchmark):对系统中单个小环节在受控条件下反复运行,得到稳定可比的信号。
可微基准测试的对象不限于模型本身,例如:
- 起草 prompt 耗时
- 每秒处理 token 数
- 向量检索 p50/p95 延迟
- 不同检索文档集的单次延迟
- MCP / API 调用等待时间
- 不同 batch size 下的 embedding 吞吐
- 平均迭代次数与单次迭代耗时
- 缓存命中率与延迟
- 并发请求下的内存占用
核心论点:端到端 eval 只能告诉你系统整体是否变好,当整体延迟变化不大时很难定位是哪个组件出了问题;而微基准给出单组件信号,让回归(regression)更容易发现和排查。他强调两者不是替代关系——evals 告诉你系统有没有变好,微基准帮你搞清为什么。
「编程与Agent」频道最新
- 开发者用 Obsidian v5 打造 AI 自动化 vault,五大手工事项全免了 — dSebastien · 2026-10-08
- Hashimoto 出品 Rex:为 AI 编码终端体验打造的分屏终端 — ricklamers · 2026-10-08
- DAIR.AI 整理 31 篇递归自我改进论文,从 Schmidhuber 到最新技术 — omarsar0 · 2026-10-08
- 「最烂代码都是人写的」:开发者反呛 AI 代码质量焦虑论 — DoctorJosh · 2026-10-08
- 转发「现代开发者应聚焦的技能」短视频,称建议具体实用 — rseroter · 2026-10-08
- 2026 年 AI 工程师修炼清单:从 Python 到上线一个真 Agent — nevrekaraishwa2 · 2026-10-08