LLM 评审门控误报频发,作者开源噪声基线方案解决

alexpran · reddit · 2026-09-09

作者分享 CI 中 LLM-as-judge 质量门控的踩坑与修复:21 个用例的评分门控某天突然报回归(5/5 → 2/5),排查后发现 prompt、模型、配置完全一致,15 分钟后评分自己恢复——是评审模型的随机噪声。教训:误报的门控一个月内就会被团队静音,真回归反而漏过。

改进方案(已开源,Apache-2.0):

作者还用它拦下了两个「看起来合理」的 judge prompt 改动:对比基线显示其中一个 recall 从 0.80 掉到 0.50,超出噪声带。局限也如实说明:噪声带是 K 次采样的 min/max 而非置信区间,需要先建基线才能用,且 LLM-as-judge 本身的局限仍在。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →