tiny 分类模型 Jev 对打 Claude 全家桶:自测文本理解不落下风
vesko_st · x · 2026-09-22
Lightfield 的 Ves Stoyanov 实测了 TypeSafe 新发布的小型分类模型 Jev——一个输入文本和问题、从给定选项中返回唯一答案的「System One Choice」原语。他质疑公共 benchmark 可能已混入预训练数据、榜单数字过时,因此做了两件事:用统一协议自行重测所有模型,并手写一个语料库作污染对冲。对比对象是 Claude Haiku 4.5、Sonnet 5 和 Opus 5,在 CommonsenseQA、MMLU-CF、RACE-H、Grace 等文本理解基准上按每 1000 条长文本问题的成本计价。结论是这个小分类器在文本理解上已具备竞争力,说明曾被生成式 LLM 淘汰的专用分类模型路线重新值得考虑。
所属事件:微型分类模型Jev实测媲美Claude成本仅约一百五十分之一(2 条相关)→
「模型」频道最新
- 安全护栏毁了叙事:视频模型画面如电影,打斗戏却集体「退缩」 — CurieuxExplorer · 2026-09-22
- 基于 Qwen3.8-27B 的写作微调模型 Hemmingway-1 上架 Hugging Face — CurieuxExplorer · 2026-09-22
- GPT-6 Astra 多次把模拟人物推下悬崖,Grok/Gemini/Claude 都拒绝了 — CurieuxExplorer · 2026-09-22
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22