CMU 论文:决策式 judge 以 0.36% 成本逼近 SOTA LLM 评审
CarnegieMellonU · hf · 2026-09-23
卡内基梅隆大学的论文提出 JEV-as-a-Judge:用仅需决策输出的 judge 做经济的第一轮评估,判断何时需要更强的评估器。在 16 个生成式与 reward-model judge 对比、 blinded 人工裁决下:
- 在普通偏好判断与基于证据的事实性任务上,与最强 SOTA LLM judge 差距在 3 个百分点内,成本仅为后者的 0.36%
- 差距主要出现在需要核对推导过程或抵御精心编写的错误答案的场景
- 多个 benchmark 上 JEV 与对手的差距集中在低置信度决策上
- 冻结级联(frozen cascade):接受高置信度裁决、升级不确定样本,可保留对手 99% 的准确率且成本更低
所属事件:Jev-as-a-Judge:廉价评审级联省 43% 成本仅失 1% 精度(2 条相关)→
「研究」频道最新
- ECCV 2026 论文探讨预训练视觉编码器高维潜在特征的可扩散性 — _akhaliq · 2026-09-25
- LeWAM 轻量世界动作模型问世,RoboTwin 2.0 成功率达 92.28% — udmrzn · 2026-09-25
- 开源 SmolDataEnvs 发布:5000+ 可验证 RL 任务用于小型模型训练 — ben_burtenshaw · 2026-09-25
- ROTATE 智能体协作训练拿下 NeurIPS 2026 Spotlight — cuijiaxun · 2026-09-25
- 开源 Jive 用「快慢思考」重构 Agent 循环,速度和 token 成本碾压 Codex — burakyildizdev · 2026-09-25
- Lovett 等发表突破性论文,人机协作攻克复杂性理论长期难题 — fortnow · 2026-09-25