Jev 做 LLM 评测裁判:快 20-200 倍,跑一堆提示不到 0.1 美元
minchoi · x · 2026-09-20
把 Jev 当 LLM-as-a-judge 用几乎是免费的:它对模型输出打分的速度比通用 LLM 快 20-200 倍、便宜 40-400 倍。@YuchenjUW 实测大量提示后花费仍未超过 0.10 美元,称这会让自动化评测「快到近乎免费」。
对需要批量评估模型输出、做自动化筛选的工程场景,这类专用决策模型可能显著压低 eval 成本。
「编程与Agent」频道最新
- 施密特预言 UI 将消失:未来 90% 网络流量是 AI 代理 — rohanpaul_ai · 2026-09-20
- 用 GPT 6 Astra 做出可游览的桃花源记,配李立宏真人朗诵 — dotey · 2026-09-20
- 开源 demo:Jev+Kimi K3 两级路由,100 封邮件分类仅花 $0.07 — nutlope · 2026-09-20
- Gemini CLI 修复显式指定 Gemini 3 Pro 被静默升级到 3.1 的 Bug — FanouZeng-TT · 2026-09-20
- 多模型互查仍会漂移:作者论证没有模型能监督好自己 — alexcovo_eth · 2026-09-20
- 从入门到生产:10 个 AWS 上的 Agentic AI 实战项目 — _jaydeepkarale · 2026-09-20