Kev 4B 对比 Jev:精度打平,但 Jev 每次请求多算 257 个 token
facethef · reddit · 2026-09-26
Opper 团队将 Jared Palmer 发布的 Apache-2.0 开源微调模型 Kev 4B(基于 Qwen3.5-4B)与 Jev 在同一端点上并列实测,并构建了一套两模型发布之后的新题集来避免训练数据污染。
评测设置
- 362 个全新测试项:新 arXiv 论文、Stack Exchange 问题、GitHub issues,答案取自原始来源
- 评测代码、测试项与结果均已开源在 GitHub
主要发现
- 各任务准确率差距均在 2 个百分点以内,在该样本量下属于噪声范围
- Jev 校准度更好,在复述检测 PAWS 上领先(87.0% vs 74.5%)
- 两者标价相同,但 Jev 每次请求固定多计约 257 个输入 token(直连 TypeSafe 也是同样计数),短请求成本最高可达 12 倍
结论:开源 4B 微调模型在能力上已能与商业模型打平,而计费口径的差异可能才是实际使用成本的关键。
「模型」频道最新
- Perceptron 具身推理模型 Mk1.5 上架 OpenRouter — AkshatS07 · 2026-09-26
- 爆料盘点:Sonnet 5.5、Kimi K3.1、Gemini 4 等新模型在路上 — kimmonismus · 2026-09-26
- 斯坦福教授:前沿模型在专业领域暴露「装懂」的表演式理解 — anshulkundaje · 2026-09-26
- HyperWrite 创始人 Matt Shumer 放话:本地模型毫无用处 — mattshumer_ · 2026-09-26
- 用户吐槽 Grok 拒答日趋荒谬,SuperGrok 订阅者掀起退订潮 — Promptmethus · 2026-09-26
- Every 实测 Anthropic Fable 5.1:更强更快,token 消耗仅 Opus 5 一半 — every · 2026-09-26