MLflow 实测:GPT-OSS-120B 作 LLM 评审 72/72 全对,压过专用模型 Jev
kalyan_kpl · x · 2026-10-03
- Databricks 团队在更难的测试集上对比 TypeSafe 的结构化判断模型 Jev(typesafe/jev-1.13)与 GPT-OSS-120B 作为 LLM judge 的表现。
- 测试集:12 道题各配 1 个正确答案和 2 个「几乎正确」的错误答案,英文日文双语共 72 个答案,错误类型包括 API 名写错、源/目标角色颠倒、缺少权限、正确论述后接错误限定等。
- 结果:Jev 两轮均 64/72 与人工标注一致(每语言 32/36),接受了全部正确答案包括改写版本;GPT-OSS-120B 则 72/72 全对。
- 效率:GPT-OSS-120B 中位延迟 0.20s vs Jev 1.44s;GPT-OSS-120B 估算成本约 $0.020/千次判断。回溯分析显示,把不确定判断路由给第二个模型可纠正漏判,升级率低于 20%。
「研究」频道最新
- Hutter 等新论文:理解泛化需要通用归纳与视角化 Solomonoff 归纳 — examachine · 2026-10-03
- NVIDIA 团队获 Biohub 细胞追踪 Kaggle 赛第 10 名,约 4000 队参赛 — JFPuget · 2026-10-03
- Krea 2 Turbo 2 步蒸馏 LoRA 新 checkpoint:降噪提速 4 倍 — TimeTruth2490 · 2026-10-03
- 哈佛物理学家用开源 BootLoops 三个月产出 36 篇 AI 论文手稿 — The Decoder · 2026-10-03
- 164MB 开源语音识别模型 Phonon-2 达近 Parakeet 水准 — EruditeCoder · 2026-10-03
- AI 创业者提出五原则:用神经符号方法绕开版权训练争议 — examachine · 2026-10-03