AI裁判高估新模型,漏判隐藏质量缺陷

rohanpaul_ai · x · 2026-07-06

分析指出,用AI作裁判(LLM-as-judge)能方向性追踪模型进步,但会漏掉人类评估者能发现的隐藏质量问题。

自动裁判在早期模型上与人类一致率约3%,却严重高估新模型:GPT-5.5的人类通过率从6.25%被高估到17.9%,Opus 4.8从8.33%被高估到18.8%。说明自动化评测对新模型可能系统性失真。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →