LLM 评委会随托管模型悄悄漂移,你的评测还准吗?

paratha27 · reddit · 2026-08-27

一位从业者分享 LLM-as-judge 的校准实践:他只用 LLM judge 判断摘要是否忠实于原文这一无法精确匹配的维度,其余指标全部 exact match;judge 先用人工标注集校准,并在每个分数旁报告一致率。

但他指出核心隐患:judge 跑在会无预警更新的托管模型上,测量工具和被测对象在同一时间线上漂移。他向社区提问:校准集要多大,一致率下降才算是信号而非噪声?有没有人真的靠这种方式抓到过 judge 变坏?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →