LLM 评分靠得住吗?警惕位置偏见与过拟合

Innowise_ · reddit · 2026-08-26

文章探讨了 LLM-as-a-judge 在自动化评估中的有效性与局限。作者主张分层评估:确定性要求(如 Schema 校验)使用自动化测试;开放式质量要求使用 LLM 评审;高风险或争议结果仍需人工复核。为提高可信度,建议将生成与评判模型分离,并使用细粒度的评分标准而非笼统的 1-5 分。

文章指出了该方法的主要缺陷,包括位置偏见、冗长偏见、评分标准敏感性以及“生成器过拟合评判器”的风险——即模型可能学会取悦评判器而非真正提升用户体验。作者建议定期比对人类评分与模型评分以监控评判器性能,并重视多评判器结果不一致背后的原因。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →