只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6
TypeSafe 推出的 Jev 是一个不生成文本、仅对「是/否、多选、打分」等类型化问题输出概率的模型。有博主在 49 个任务、约 8200 条数据(涵盖 SST-2、MMLU 等)上实测,发现 Jev 在 42 项任务中追平或超过 GPT-5.6-luna。不过 @whereischarly 认为将其与 LLM 直接比较意义不大——Jev 本就不是 LLM,速度快是理所当然的,他转而将其与 Hugging Face 上的其他判定模型对比,发现 Jev 准确率胜出,却在速度上落败。
2026-09-19 ~ 2026-09-19 · 3 条相关
- 第 1 集:TypeSafe 结束隐身发布决策模型 Jev 与新训练法 RLCD(2026-09-16,86 条)
- 第 2 集:TypeSafe AI 发布专用评估模型 Jev,实测速度与成本优势显著(2026-09-16,8 条)
- 第 3 集:Vercel fx 安全审查将换用 Jev 快 18 倍(2026-09-17,3 条)
- 第 4 集:OpenJev 开源:单张 3090 本地复刻 Jev 服务(2026-09-17,3 条)
- 第 5 集:TypeSafe AI 发布决策模型 Jev:不生成文本、只输出结构化决策(2026-09-17,73 条)
- 第 6 集:TypeSafe Jev 模型生态爆发,六大 GitHub 项目覆盖代理与自动交易(2026-09-18,2 条)
- 第 7 集:TypeSafe Jev 靠 LLM 概率分类,大厂可轻易复制(2026-09-18,2 条)
- 第 8 集:TypeSafe AI 发布分类模型 Jev,宣称快 200 倍、便宜 400 倍(2026-09-19,6 条)
- 第 9 集:只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6(2026-09-19,3 条)
- 反常识实测:判定模型 Jev 准确率胜出,却输在以之命名的速度上 — alexisgallagher · 2026-09-19
- 只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna — LowNefariousness9966 · 2026-09-19
另有 1 条近重复转述:LowNefariousness9966