JEV-as-a-Judge:置信度路由级联,超 GPT-6 准确率仅花 41% 费用
kalyan_kpl · x · 2026-10-11
arXiv 论文《JEV-as-a-Judge: Accept When Confident, Escalate When Unsure》(CMU 团队)提出用只输出标签概率、不生成文本的 JEV 决策模型做裁判,用其置信度决定是否升级到推理型裁判。
- 在 16 个生成式与奖励模型裁判对比中(含盲评人工裁定),凡是能直接从文本读出判决的任务,JEV 准确率与 GPT-6 相差不到 3 分,费用仅为其 0.36%,中位延迟 0.15 秒
- 在数学、代码、逻辑等需要推导的任务上落后;其置信度恰好标记了这条能力边界
- 核心结果:预先冻结置信度阈值,接受高置信判决、其余升级给 GPT-6,在 1,610 个 held-out 对上比 GPT-6 高 0.9 分,费用只有 41%;在两个新工作负载的预注册实测中,级联准确率与 GPT-6 完全持平
- 局限:在风格对抗样本和免参考长文评估上路由能力减弱;论文附带了在本地验证阈值的简单配方
所属事件:JEV 裁判模型逼近 GPT-6 准确率,成本大降(2 条相关)→
「模型」频道最新
- 马斯克晒 Grok 代购乐高:一句话完成调研加下单 — elonmusk · 2026-10-11
- Google 发布 EmbeddingGemma 2:7.4 亿参数多模态嵌入可跑在手机上 — dl_weekly · 2026-10-11
- 爆料称 Grok 4.8 参数达 2.5 万亿,较上代激增 67% 即将发布 — mark_k · 2026-10-11
- TensorFold 1.0.7 上线 Living Weights:一条事实写入约 10 个新神经元 — HankYeomans · 2026-10-11
- Arena 榜单 88 分 vs 83 分差多少?实测误差率相差一倍 — i_dg23 · 2026-10-11
- 曝 Anthropic 下一代模型 Fable 5.5 一次生成即成 SVG — koltregaskes · 2026-10-11