Jev 被指「新范式」名不副实:基线对比 BGE+逻辑回归 93.3% 完胜其 83.2%
tiensss · reddit · 2026-09-24
Reddit 用户发文质疑被宣传为「新一类决策模型」的 Jev(System One Models),认为其大部分卖点不过是经典分类器行为加上现代 zero-shot 能力:对受限选项输出概率、不做自回归生成、不会输出无效类别、可在推理时定义标签——这些零样本/NLI 分类器、嵌入模型、cross-encoder 和 reranker 多年前就在做。
作者指出两个问题:一是 Jev 最亮眼的对比对象是 LLM——专用分类器当然比让自回归 LLM 生成答案更快更便宜,这不构成新范式;有意义的对比应是强基线分类器。ICLR 有 BTZSC 基准覆盖 22 个数据集上的数十个零样本分类器,但没见 Jev 在这个体系里被认真测过。
二是已有社区对比结果远没有那么神奇:一个 Banking77 实验中,BGE-small + 逻辑回归拿到 93.3% 准确率(本地约 9ms),而 Jev 只有 83.2%(GitHub: jev-baselines-eval)。作者结论:公开证据只表明「用分类器做分类比 LLM 便宜快」这一已知事实,除非其未公开架构或 RLCD 训练方法确实新颖,否则谈不上新一类 AI——只有认为 AI 始于 LLM 的人才会觉得新鲜。
「公司和人」频道最新
- 企业客户灵魂拷问:这些垂直AI公司18个月后还在吗 — arieljalali · 2026-09-24
- Scale AI CEO 调侃 Meta 新模型 Muse:这是「Temu 版集成」? — alexandr_wang · 2026-09-24
- 吴恩达反驳「别学编程」:AI 时代恰恰人人更该学 — dotey · 2026-09-24
- 哈佛长寿峰会开幕:学者称 AI 助力 10-15 年内 defeat aging — DeryaTR_ · 2026-09-24
- Interintellect 创始人 Anna Gát 谈让科技圈重新爱上人文 — kyliebytes · 2026-09-24
- 李飞飞:真正的生存威胁从来不是 AI,而在人类自身 — irinarish · 2026-09-24