只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna
LowNefariousness9966 · reddit · 2026-09-19
博主拿到 TypeSafe 的 Jev——一个不生成文本、只对「是/否、多选、打分」类类型化问题输出概率的模型——并在 49 个任务、约 8200 条数据(SST-2、MMLU、ARC、MS MARCO、XNLI、SQuAD、Banking77 等)上与 gpt-5.6-luna 对比:
主要结果
- 42/49 任务持平或胜出
- 中位延迟 105ms vs 700-800ms;成本 $0.04/千条 vs $0.16-0.19
- 校准误差约为基线一半,概率真正可用
- 推理类反而更强:LogiQA 0.77 vs 0.59、WinoGrande 0.89 vs 0.66、ARC-Challenge 0.97 vs 0.87、MMLU 0.94 vs 0.87
- 为排除记题,用 Fable 5.1 生成 120 道新数学应用题:Jev 得 0.75(与其 GSM8K 0.72 相当),无推理的 Luna 仅 0.17
- 重排任务明显胜出(NFCorpus nDCG@10 0.73 vs 0.63),且 Luna 每条查询需 1-3 秒
劣势
- 列表计数 0.87 vs 0.99;77 类意图分类 0.81 vs 0.87
- 问题及其否定式的概率之和不等于 1,平均偏差约 0.3
- 私测中单请求塞入 100 篇长文档时,会给完全无关文档打高相关分,干净基准测不出这一点
作者注明基准污染风险(自建数学题是唯一对照)、基线刻意限制为无/低推理、每任务 200 条使 <0.05 差异属噪声,且 Jev 不能写文本/调工具/解释自己——它替代的不是 LLM 本身,而是围绕 LLM 的小分类器、重排器和相关性判断调用。任务构建器、跑分脚本、原始结果均已开源(stdlib-only Python)。
所属事件:只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6(3 条相关)→
「模型」频道最新
- Tobi 谈 Jev 之争:判别式模型难做通用分类器 — caglar_ee · 2026-09-19
- AgentSky 上线:浏览器免装调用 40+ 编码 Agent 可横向比价 — Aiden_Tech_Ai · 2026-09-19
- GPT-6 据传推迟一周,或于 DevDay 前发布并演示 Jony Ive 硬件 — haider1 · 2026-09-19
- 开发者:开源模型不少能力无需推理就能激发,却少有人知 — cephaloform · 2026-09-19
- 传 ChatGPT 取消免费用户最烦人限制:文本对话不限量 — nikola_mr64990 · 2026-09-19
- 能跑评测但不能发表:DeWitt 条款让消费者无从知情 — suchenzang · 2026-09-19