开发者换用 Jev 做 LLM 评判:成本降 200 倍、速度快 50 倍
indragie · x · 2026-09-25
开发者 rbro112 分享把一套 eval 评判数据集从 Gemini 3.1 迁移到 typesafeai 的 Jev 一周后的结果:
- 评分精度没有实质变化
- 成本约便宜 200 倍(单次评判约 $0.01 → 约 $0.00005)
- 速度快约 50 倍(中位数约 10 秒 → 约 0.2 秒)
- 输入 token 少约 50%,输出 token 少 87%
他也提到并非完美无缺,细节见原帖。对做 LLM-as-judge 评测管线的人来说是一份有数字参考的迁移实测。
「模型」频道最新
- Google 新 Gemini 4 Pro 检查点现身 Arena,胜 GPT-6 Astra — cedric_chee · 2026-09-26
- LeCun 断言仅靠 scaling LLM 绝无可能达到 AGI — aran_nayebi · 2026-09-26
- 用户吐槽 Claude 过度谨慎:「像在跟悲观同事聊天」 — Vast_Caramel_3669 · 2026-09-26
- Anthropic 官方盘点:Opus 5.5 发布数日用户玩出的花样 — claudeai · 2026-09-26
- 动效师晒图:一条 prompt 让 Opus 生成动画,直追手工作品 — motionbynick · 2026-09-26
- NaceAI 开源级小模型 Drex 登顶决策榜,号称击败 Jev 还送 2.5 亿 token — Hesamation · 2026-09-25