LLM 评审门控误报频发,作者开源噪声基线方案解决
alexpran · reddit · 2026-09-09
作者分享 CI 中 LLM-as-judge 质量门控的踩坑与修复:21 个用例的评分门控某天突然报回归(5/5 → 2/5),排查后发现 prompt、模型、配置完全一致,15 分钟后评分自己恢复——是评审模型的随机噪声。教训:误报的门控一个月内就会被团队静音,真回归反而漏过。
改进方案(已开源,Apache-2.0):
- 每个用例对已批准版本多次运行,把波动区间记录在参考基线里;只有超出噪声带的下降才算回归,否则报告标注「在噪声内」。
- 参考基线是仓库里的文件(逐用例分数、prompt、模型、temperature、commit),批准新基线即一次签名 commit,无需服务器。
- 报告先展示配置变更(如 temperature 0.3 → 0.7)再列分数,因为答案通常在那。
作者还用它拦下了两个「看起来合理」的 judge prompt 改动:对比基线显示其中一个 recall 从 0.80 掉到 0.50,超出噪声带。局限也如实说明:噪声带是 K 次采样的 min/max 而非置信区间,需要先建基线才能用,且 LLM-as-judge 本身的局限仍在。
「编程与Agent」频道最新
- Interrupt NYC 大会将办,Weber Shandwick 分享 LangGraph 智能体工厂实践 — LangChain · 2026-09-09
- 该从 Agent 里删掉什么?Superpowers 14 个技能 2 万字引发反思 — aofu_dev · 2026-09-09
- Neon 改口:OpenAPI 规格转 MCP 服务器不再是「糟糕默认」 — tristanbob · 2026-09-09
- DeepSeek V4.1 Flash 盲测登国产第一,换客户端暴跌近 17 分 — teortaxesTex · 2026-09-09
- 设计师把客户简报 discovery 交给 AI agent,每单省回 2 小时 — Tegadesigns · 2026-09-09
- PolyAI 发布 Wren:一个日夜自动改进其他对话 Agent 的编码 Agent — matthen2 · 2026-09-09