LLM 评委会随托管模型悄悄漂移,你的评测还准吗?
paratha27 · reddit · 2026-08-27
一位从业者分享 LLM-as-judge 的校准实践:他只用 LLM judge 判断摘要是否忠实于原文这一无法精确匹配的维度,其余指标全部 exact match;judge 先用人工标注集校准,并在每个分数旁报告一致率。
但他指出核心隐患:judge 跑在会无预警更新的托管模型上,测量工具和被测对象在同一时间线上漂移。他向社区提问:校准集要多大,一致率下降才算是信号而非噪声?有没有人真的靠这种方式抓到过 judge 变坏?
「编程与Agent」频道最新
- 开源团队版编程 Agent 控制室,支持多人协作 — ricklamers · 2026-08-27
- 构建智能体基础设施应注重工程而非组织架构 — intellectronica · 2026-08-27
- HQ 定位解读:给人类与 AI 混编团队做一套操作系统 — jacob_posel · 2026-08-27
- 实战案例:AI 员工自动提取录音要点并生成三篇内容初稿 — thisdudelikesAI · 2026-08-27
- Perplexity Agent API 新增 Connectors,支持直连 GitHub 与 Slack — AravSrinivas · 2026-08-27
- Agent 仍无长期记忆:用户被迫每会话重复授权 — davidfromkansas · 2026-08-27