论文:分类器当评审与 LLM 评审同样会错,96% 错误重合

deliprao · x · 2026-09-28

新论文《JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places》提出 JEV:不做文本生成、直接在固定答案集上输出概率的评审器,单次请求即可处理一份提交的全部评分标准。

关键发现:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →