Jev 做 LLM 评测裁判:快 20-200 倍,跑一堆提示不到 0.1 美元

minchoi · x · 2026-09-20

把 Jev 当 LLM-as-a-judge 用几乎是免费的:它对模型输出打分的速度比通用 LLM 快 20-200 倍、便宜 40-400 倍。@YuchenjUW 实测大量提示后花费仍未超过 0.10 美元,称这会让自动化评测「快到近乎免费」。

对需要批量评估模型输出、做自动化筛选的工程场景,这类专用决策模型可能显著压低 eval 成本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →