开发者换用 Jev 做 LLM 评判:成本降 200 倍、速度快 50 倍

indragie · x · 2026-09-25

开发者 rbro112 分享把一套 eval 评判数据集从 Gemini 3.1 迁移到 typesafeai 的 Jev 一周后的结果:

他也提到并非完美无缺,细节见原帖。对做 LLM-as-judge 评测管线的人来说是一份有数字参考的迁移实测。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →