论文:分类器当评审与 LLM 评审同样会错,96% 错误重合
deliprao · x · 2026-09-28
新论文《JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places》提出 JEV:不做文本生成、直接在固定答案集上输出概率的评审器,单次请求即可处理一份提交的全部评分标准。
关键发现:
- 在二元判断上,JEV 与商用 LLM 评审表现相当,且更快更便宜;但在分级评分上存在明显短板。
- 当 JEV 自信地犯错时,昂贵的 LLM 评审有 96% 的概率犯完全相同的错误。
- 分级评分的误差来自共同的量表压缩问题;自动评审系统性给出低于人类评分者的分数。
- 错误高度相关意味着「评审级联 + 兜底」的价值有限:当 benchmark 本身依赖未写明的标准时,加大评审算力也无济于事。
「模型」频道最新
- GPT-6 Sol 现身 LMArena:Direct Mode 开放 24 小时限时实测 — arena · 2026-09-28
- Kaggle Game Arena:用象棋扑克狼人杀评测 LLM 防饱和 — weballergy · 2026-09-28
- Qwen3.8-27B 上线 Nebius Token Factory,主打多步规划 — HowDevelop · 2026-09-28
- AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击 — ShakeelHashim · 2026-09-28
- Codex 电脑操作能力被阉割,用户转用 Opus 5.5 一次成功 — iannuttall · 2026-09-28
- 书生发布 Intern-Decision 多模态模型家族,4B 版超越 Jev 1.13.0 — stingning · 2026-09-28