JEV 当裁判仅比 GPT-6 低 1.7 分,成本却便宜 277 倍
kalyan_kpl · x · 2026-10-11
Kalyan 分享了对 JEV 决策模型作为 LLM-as-a-judge 裁判的评测结果。
- JEV 在 15 个被评测的裁判中排名第 8,整体准确率仅比 GPT-6 低 1.7 分
- 成本只有 GPT-6 的 1/277,中位响应时间 0.15 秒(GPT-6 为 1.89 秒)
- 有趣发现:可以把 JEV 和 GPT-6 组合成级联裁判——当 JEV 置信度高时直接采纳其判决,否则再调用 GPT-6 裁判
所属事件:JEV 裁判模型逼近 GPT-6 准确率,成本大降(2 条相关)→
「模型」频道最新
- 马斯克晒 Grok 代购乐高:一句话完成调研加下单 — elonmusk · 2026-10-11
- Google 发布 EmbeddingGemma 2:7.4 亿参数多模态嵌入可跑在手机上 — dl_weekly · 2026-10-11
- 爆料称 Grok 4.8 参数达 2.5 万亿,较上代激增 67% 即将发布 — mark_k · 2026-10-11
- TensorFold 1.0.7 上线 Living Weights:一条事实写入约 10 个新神经元 — HankYeomans · 2026-10-11
- Arena 榜单 88 分 vs 83 分差多少?实测误差率相差一倍 — i_dg23 · 2026-10-11
- 曝 Anthropic 下一代模型 Fable 5.5 一次生成即成 SVG — koltregaskes · 2026-10-11