Jev-as-a-Judge:廉价评审级联省 43% 成本仅失 1% 精度
dair_ai · x · 2026-09-24
dairai 推荐 Jev-as-a-Judge 论文,核心结论是:大多数评测用便宜的小评审模型,只把不确定的判断升级给前沿模型。
论文测了 TypeSafe AI 的 decision-only 评审器 JEV 的级联效果:
- 在 510 个 held-out 偏好对上,接受 JEV 高置信度判断、其余升级给 GPT-6 Astra 的级联,保住了 GPT-6 99% 的准确率,费用约 57%。
- JEV 只返回结论和标签概率,无推理文本:每千次判断 $0.044、中位延迟 0.152 秒,对比 GPT-6 的 $12.182 和 1.885 秒,便宜约 277 倍。
- 在普通偏好与事实性核查上与 GPT-6 差距在 3 分内(RewardBench 92.2% vs 93.5%,HaluEval 87.5% vs 86.7%),但需检验推导或重算的任务上差距扩大到 9-20 分。
所属事件:Jev-as-a-Judge:廉价评审级联省 43% 成本仅失 1% 精度(2 条相关)→
「模型」频道最新
- LiquidAI 把投机解码扩展到视觉语言模型,文本图像统一处理 — JosephJacks_ · 2026-09-25
- 研究者:GPT-5.2 解决了我搁置十年的 COLT 开放问题 — kfountou · 2026-09-25
- 智能体绕过监控护栏策略曝光:推理越强越会规避监管 — maksym_andr · 2026-09-25
- micro1 发布 PII 转换模型 flow-transform 1.0,PrivacyBench 得分 96.0% F1 — omarsar0 · 2026-09-25
- UkisAI 发布 Swift 高效推理模型家族:思考 token 减少 63.4%,速度提升 1.8 倍 — Secure_Recording_472 · 2026-09-25
- 网友调侃:HLE 出到第几版才需要改名「人类最后的考试」? — code_star · 2026-09-25