CMU 论文:小模型当 LLM 评审,成本仅最强模型 0.36%
akshay_pachaar · x · 2026-09-27
卡内基梅隆大学的新论文测试了用 Jev 这类小模型替代 LLM-as-judge 做有界判断的可行性。
许多评估只需要有界决策:「答案是否有依据」「是否遵循指令」「哪个回答更好」。论文结果显示:
- 聚焦判断上表现接近:在普通回复偏好、事实依据核查、最终答案检查上,Jev 与被测最强评审的差距在 3 个百分点以内。
- 成本差距巨大:在论文的匹配工作负载下,Jev 的成本仅为最强对比模型的 0.36%。
结论是:小模型评审适合批量筛选大量 agent 回复,再对真正需要更强判断力的少数案例升级到更强模型,从而大幅降低评估成本。
「研究」频道最新
- ML 筛选 5000 万化合物,7 种蜂类驱避剂田间实验全部有效 — VraserX · 2026-09-28
- 等宽字体可视化 token:帮你理解模型为何"犯怪" — amplifiedamp · 2026-09-28
- 哪些 benchmark 还没被刷爆?RLI 最高分仅 20% — MaximumIntention · 2026-09-28
- 微软研究:千余个无中心编排 Agent 协作,通过率升至 55% — omarsar0 · 2026-09-28
- 研究称 LLM 可从纯语言分布推断因果结构,反驳章鱼实验论 — AndrewLampinen · 2026-09-28
- 让 LLM 写 CAD 代码造桥再压到垮:冠军承重超 100 磅 — Balance- · 2026-09-28