180 倍成本差:小模型 Jev 替代 LLM 评审仅差 2.6 分精度

ialijr · reddit · 2026-10-10

作者想知道 Jev 能否替代 agent eval 里的 LLM 评审(Sonnet、Haiku、Gemini Flash Lite),于是重放 193 条真实 eval 判定,与人工标注对比,各跑 5 次:

最佳方案是级联:Jev 先过,仅约 16% 不确定条目交 Sonnet 复核——达到 Sonnet 级精度,成本降至 1/6。

结论:Jev 不是替代品,而是非常好的第一道筛。报告附完整方法、按 rubric 类型细分结果、校准与级联图表、移植自家 rubric 的代码示例及可复现的开源仓库。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →