180 倍成本差:小模型 Jev 替代 LLM 评审仅差 2.6 分精度
ialijr · reddit · 2026-10-10
作者想知道 Jev 能否替代 agent eval 里的 LLM 评审(Sonnet、Haiku、Gemini Flash Lite),于是重放 193 条真实 eval 判定,与人工标注对比,各跑 5 次:
- Jev:准确率 90.6%,每 1000 条判定仅 $0.07
- Sonnet 4.6:准确率 93.2%,每 1000 条 $13.21(贵约 180 倍)
- Jev 在「有信心」的 125/191 条目上零错误
最佳方案是级联:Jev 先过,仅约 16% 不确定条目交 Sonnet 复核——达到 Sonnet 级精度,成本降至 1/6。
结论:Jev 不是替代品,而是非常好的第一道筛。报告附完整方法、按 rubric 类型细分结果、校准与级联图表、移植自家 rubric 的代码示例及可复现的开源仓库。
「编程与Agent」频道最新
- 开发者实践:常驻 VM 上「dev in prod」跑周报小软件 — davidcrawshaw · 2026-10-11
- GNOME 大版本更新弄坏 dock,AI 助手一小时内修复 — Moarkush · 2026-10-11
- GitHub CEO 分享用 Vibe Coding 打造游戏引擎的过程 — zeeg · 2026-10-11
- 开源 DeepSeek Bot 上线:把 DSH 变成可持久聊天的 Bot 团队 — teortaxesTex · 2026-10-11
- 作者用 ChatGPT 编码渲染出 4K/60fps 音乐可视化 — most_triumphant_yeah · 2026-10-11
- Valtown 创始人解释多开分支 VM:开销可忽略,基础 VM 用 systemd 保活 — davidcrawshaw · 2026-10-11