神秘判定模型 Jev 引发热议:多方实测结论分化
TypeSafe 发布的模型 Jev 引发社区广泛关注:它不生成文本,只对「是/否、多选、打分」类类型化问题输出概率,被支持者视为对 LLM 范式的挑战。9 月 18–19 日多位开发者与博主密集发布实测结果,结论明显分化,成为当周 AI 圈争议焦点。
已确认
- LowNefariousness9966 在 49 项任务、约 8200 条数据(SST-2、MMLU、ARC、MS MARCO、XNLI、SQuAD、Banking 等)上实测,称 Jev 有 42 项追平或超过 GPT-5.6-luna。
- 开发者 ekzhang1 做同成本对比:用 Qwen3.6-35B-A3B(非推理模式)搭建 Jev 兼容公开 API,仅靠 SGLang 的 radix cache 保留 prefill 复用实现极快并行生成,结果显示 Jev MMLU-Pro 达 82.9%,大幅领先通用模型的 58.8%。
- paraschopra 用 Qwen3-4B 与 400M 参数的 Laya 对比评测 Jev,基于 MMLU 等成绩与约 300ms 延迟推测其约为 30B 参数量级;其完整 gist 覆盖 120 条导航路线加 4400 个分类/决策案例,同条件对比 Jev、Laya 与自建 Qwen3-4B 决策模型,其中关系推理任务 Jev 得 0 分。
- rorybuilds 上线 Easy-Jev 在线演示,修改输入即可实时观看分类结果变化;其硕士论文方向即分类模型,称 Jev 是经典算法的现代化版本,并认同 typesafe 的观点。
- @whereischarly 认为 Jev 与 GPT-5.6 的横评没有意义——Jev 不是 LLM,快是当然的;alexisgallagher 转而将 Jev 与 Hugging Face 上多年零样本分类的开源权重编码器对比,发现 Jev 准确率胜出,却输在以其命名的速度维度上。
尚未确认
- Jev 的真实参数量(paraschopra 的 30B 仅为基于成绩与延迟的推测)与训练方式、数据来源均无官方披露。
为什么重要
- Jev 代表「不生成文本、只输出概率」的路线,若其准确率优势在同成本、同延迟条件下可复现,可能冲击 LLM 在分类与判定类任务上的默认地位;但目前各家评测口径不一、任务类型敏感(关系推理得 0 分),其实际能力边界仍待更多独立验证。
2026-09-18 ~ 2026-09-19 · 7 条相关
- 第 1 集:TypeSafe 结束隐身发布决策模型 Jev 与新训练法 RLCD(2026-09-16,86 条)
- 第 2 集:TypeSafe AI 发布专用评估模型 Jev,实测速度与成本优势显著(2026-09-16,8 条)
- 第 3 集:Vercel fx 安全审查将换用 Jev 快 18 倍(2026-09-17,3 条)
- 第 4 集:OpenJev 开源:单张 3090 本地复刻 Jev 服务(2026-09-17,3 条)
- 第 5 集:TypeSafe AI 发布决策模型 Jev:不生成文本、只输出结构化决策(2026-09-17,73 条)
- 第 6 集:神秘判定模型 Jev 引发热议:多方实测结论分化(2026-09-18,7 条)
- 第 7 集:TypeSafe AI 的 Jev 模型与 RLCD 训练法引热议(2026-09-18,3 条)
- 第 8 集:LangChain 发布 Jev 教程:构建循环式 Agent Harness(2026-09-18,7 条)
- 第 9 集:TypeSafe Jev 模型生态爆发,六大 GitHub 项目覆盖代理与自动交易(2026-09-18,2 条)
- 第 10 集:Jev 引热议:分类型 AI 崛起开辟新叙事(2026-09-18,3 条)
- 第 11 集:TypeSafe Jev 靠 LLM 概率分类,大厂可轻易复制(2026-09-18,2 条)
- 第 12 集:TypeSafe AI 发布决策模型 Jev,宣称快 200 倍便宜 400 倍(2026-09-19,7 条)
- 第 13 集:TypeSafe 首个模型 Jev 创 AI Gateway 最快采用纪录(2026-09-19,6 条)
一手来源
- 只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna — LowNefariousness9966 ·
- 博主实测神秘模型 Jev:疑似 30B 级,延迟 300ms,关系推理得 0 分 — paraschopra ·
- Jev 对比详细评测出炉:120 条导航路线加 4400 个决策案例 — paraschopra ·
- 粉丝为争议新模型 Jev 做出网页 Demo:改输入实时看分类变化 — zeeg · 2026-09-18
- 同成本实测:Jev MMLU-Pro 82.9% 大幅领先通用模型 58.8% — simonguozirui · 2026-09-18
- 反常识实测:判定模型 Jev 准确率胜出,却输在以之命名的速度上 — alexisgallagher · 2026-09-19
- 只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna — LowNefariousness9966 · 2026-09-19
- 【源头】只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna — LowNefariousness9966 · 2026-09-19
- 【源头】博主实测神秘模型 Jev:疑似 30B 级,延迟 300ms,关系推理得 0 分 — paraschopra · 2026-09-19
- 【源头】Jev 对比详细评测出炉:120 条导航路线加 4400 个决策案例 — paraschopra · 2026-09-19