反常识实测:判定模型 Jev 准确率胜出,却输在以之命名的速度上
alexisgallagher · x · 2026-09-19
有人把新判定模型 Jev 拿来和 GPT-5.6 横评,但 @whereischarly 认为这比较没意义——Jev 不是 LLM,快是当然的。他转而把 Jev 与 Hugging Face 上做了多年零样本分类的开源权重编码器对比。
结果是个反差:Jev 在准确率上赢了,却输在它名字所代表的那件事上(速度),作者开了一个 thread 展开细节。对关注轻量判定/分类模型选型的人有参考价值。
「模型」频道最新
- Epoch AI 启动基准审计:15 个基准 9 个被判「有缺陷」引反弹 — DimitrisPapail · 2026-09-19
- 研究者回应 Terminal Bench 审计争议:已知问题仅影响榜单不到 3% — AlexGDimakis · 2026-09-19
- 开发者一句话断言:FelonyBench 将取代 LMSYS 榜单地位 — dylan522p · 2026-09-19
- 用户称 Opus 5 会「在屋里做梦」,内容比其他模型更诡异 — repligate · 2026-09-19
- 爆料称智能体 Jev 疑为套壳,Qwen 2.5/3 作底座 — deliprao · 2026-09-19
- 比空间旋转更难?网友:最强模型最头疼的其实是写作 — burny_tech · 2026-09-19