CMU 论文:廉价裁判+不确定时升级,省 99.6% 评测费保留 99% 准确率
Stefania_druga · x · 2026-09-25
CMU 团队论文《JEV-as-a-Judge: Accept When Confident, Escalate When Unsure》研究 LLM-as-a-judge 的成本问题:
- 对比 16 个生成式与 reward-model 裁判,并用盲测人工裁定;JEV 决策型裁判在普通偏好判断和基于证据的事实性判断上,与最强 LLM 裁判差距在 3 个百分点内,而费用仅为其 0.36%。
- 弱点在需要核对推导过程或识别精心编写的错误答案时,差距较大。
- 关键发现:JEV 的失误集中在低置信度判断上。据此设计级联策略——置信度高时直接采纳 JEV 裁决,不确定时升级给更强 LLM——可保留约 99% 的强裁判准确率,同时大幅降低评测成本。
作者认为这种「廉价首轮裁判+不确定升级」的路由模式将非常普遍。结果限定于所测工作负载,并非普适保证。
所属事件:CMU 提出 JEV-as-a-Judge:廉价裁判级联省 99% 评测成本(4 条相关)→
「Infra」频道最新
- 并非所有任务都需要旗舰模型:本地部署与低价模型分流付费用户 — haider1 · 2026-09-25
- 4000美元搞定多卡扩展:MCIO+retimer 保住 x16 全速带宽 — TheZachMueller · 2026-09-25
- Oracle 为 Stargate 数据中心延期风险投保,暴露 AI 基建物理瓶颈 — TansuYegen · 2026-09-25
- Anthropic 向 Akamai 承诺 116 亿美元云基础设施协议 — TansuYegen · 2026-09-25
- Inference Engineer 成新热门岗位:模型服务端到端专家 — nir_benz · 2026-09-25
- FANUC 协作机器人用自然语言取件:GR00T 加 Isaac Sim 先仿真后实机 — lukas_m_ziegler · 2026-09-25