tiny 分类模型 Jev 对打 Claude 全家桶:自测文本理解不落下风

vesko_st · x · 2026-09-22

Lightfield 的 Ves Stoyanov 实测了 TypeSafe 新发布的小型分类模型 Jev——一个输入文本和问题、从给定选项中返回唯一答案的「System One Choice」原语。他质疑公共 benchmark 可能已混入预训练数据、榜单数字过时,因此做了两件事:用统一协议自行重测所有模型,并手写一个语料库作污染对冲。对比对象是 Claude Haiku 4.5、Sonnet 5 和 Opus 5,在 CommonsenseQA、MMLU-CF、RACE-H、Grace 等文本理解基准上按每 1000 条长文本问题的成本计价。结论是这个小分类器在文本理解上已具备竞争力,说明曾被生成式 LLM 淘汰的专用分类模型路线重新值得考虑。

所属事件:微型分类模型Jev实测媲美Claude成本仅约一百五十分之一(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →