自建防背诵基准实测:微型分类模型 Jev 达 Sonnet 水平、便宜约 150 倍
vesko_st · x · 2026-09-22
开发者 veskost 实测 TypeSafe AI 的小型分类模型 Jev,结论是其在分类任务上接近 Claude Sonnet 水平,而运行成本低几个数量级。
- 通用文本理解:在三个常用阅读理解与常识基准上,Jev 表现与 Opus 相当;CommonsenseQA 和 MMLU-CF 拿下第一,RACE-H 上与 Opus 打平;长上下文问题上比 Opus 便宜约 150 倍、快约 10 倍。
- 防背诵测试:作者担心基准可能已在训练数据中,于是基于一篇随机维基百科文章手工构造新基准(所有干扰项来自原文),Jev 仍与 Sonnet、Opus 同档。
- 客服/谈判任务:用较旧的客服与谈判数据集测试,Jev 略好于 Claude Haiku、略低于 Sonnet 5;作者强调这些不代表真实 B2B 销售,结论仅供参考。
作者认为这类小型廉价分类模型有真实落地价值,并计划用于自家产品 lightfld。
所属事件:微型分类模型Jev实测媲美Claude成本仅约一百五十分之一(2 条相关)→
「模型」频道最新
- 安全护栏毁了叙事:视频模型画面如电影,打斗戏却集体「退缩」 — CurieuxExplorer · 2026-09-22
- 基于 Qwen3.8-27B 的写作微调模型 Hemmingway-1 上架 Hugging Face — CurieuxExplorer · 2026-09-22
- GPT-6 Astra 多次把模拟人物推下悬崖,Grok/Gemini/Claude 都拒绝了 — CurieuxExplorer · 2026-09-22
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22