把 LLM 评测做成部署门禁:不能让构建失败的 eval 只是笔记本
rseroter · x · 2026-10-09
Stack Overflow Blog 系列文章第二部分,讲如何把 LLM 系统的评测从「出事后才跑的 notebook」变成 CI 里的部署门禁。
核心主张:
- 大多数团队做 eval 的方式像 CI 出现前做测试:偶尔、手动、事后补救。但 LLM 系统最容易被静默破坏的不是代码改动,而是一次看似无害的 prompt 微调、模型升级或 temperature 调整,可能在 8% 的输入上悄悄劣化
- 修复方法:把评测当测试——在 CI 里跑,回归就 fail 构建。不能让 prompt 改动不经 eval 拦截就上线,否则你有的只是 notebook
- 双层机制:门禁(gate)保护部署时刻,漂移检测(drift detection)保护部署后的数周,两者需要不同的机器
- golden case 应当作为数据管理:覆盖常见场景、已知困难场景、以及每一个修过的历史故障(回归用例永不删除),与代码一起进版本控制,用例集变更走 code review
属于一套 LLM 评测成熟度模型的 Level 2(评测)层级。
「编程与Agent」频道最新
- OpenAI 编码 Agent steering 改为即时响应,并放出 ultrafast 新版 — Dimillian · 2026-10-09
- 机器人老兵吐槽:别让 LLM 天天生成新的开源机器人库 — kscottz · 2026-10-09
- Modal 推出 Sidecars,跨信任边界通信提速 3 倍护航 Agent 沙箱 — AAAzzam · 2026-10-09
- sudo L7 基准:60 项真实生产任务,最强编码 agent 仅通过 45% — echen · 2026-10-09
- 谷歌 FlowAgent 进 CI 修测试失败:195例人工核验67%正确,上线后建议28.5万次 — omarsar0 · 2026-10-09
- 开发者反馈 GLM-5.3 在 Cursor CLI 中工具调用疑似完全失效 — DanielLockyer · 2026-10-09