CMU 论文:小模型当 LLM 评审,成本仅最强模型 0.36%

akshay_pachaar · x · 2026-09-27

卡内基梅隆大学的新论文测试了用 Jev 这类小模型替代 LLM-as-judge 做有界判断的可行性。

许多评估只需要有界决策:「答案是否有依据」「是否遵循指令」「哪个回答更好」。论文结果显示:

结论是:小模型评审适合批量筛选大量 agent 回复,再对真正需要更强判断力的少数案例升级到更强模型,从而大幅降低评估成本。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →