只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna
LowNefariousness9966 · reddit · 2026-09-19
博主拿到 TypeSafe 的 Jev——一个不生成文本、只对「是/否、多选、打分」类类型化问题输出概率的模型——并在 49 个任务、约 8200 条数据(SST-2、MMLU、ARC、MS MARCO、XNLI、SQuAD、Banking77 等)上与 gpt-5.6-luna 对比:
主要结果
- 42/49 任务持平或胜出
- 中位延迟 105ms vs 700-800ms;成本 $0.04/千条 vs $0.16-0.19
- 校准误差约为基线一半,概率真正可用
- 推理类反而更强:LogiQA 0.77 vs 0.59、WinoGrande 0.89 vs 0.66、ARC-Challenge 0.97 vs 0.87、MMLU 0.94 vs 0.87
- 为排除记题,用 Fable 5.1 生成 120 道新数学应用题:Jev 得 0.75,无推理的 Luna 仅 0.17
- 重排任务明显胜出(NFCorpus nDCG@10 0.73 vs 0.63)
劣势
- 列表计数 0.87 vs 0.99;77 类意图分类 0.81 vs 0.87
- 问题及其否定式的概率之和不等于 1,平均偏差约 0.3
- 私测中单请求塞入 100 篇长文档时,会给完全无关文档打高相关分
作者注明基准污染风险、基线刻意限制为无/低推理、每任务 200 条使 <0.05 差异属噪声,且 Jev 不能写文本/调工具/解释自己——它替代的是围绕 LLM 的小分类器、重排器和相关性判断调用。任务构建器、跑分脚本与原始结果已开源。
所属事件:只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6(3 条相关)→
「模型」频道最新
- AI 日报:Grok 语音转写 2.0 上线,Meta Muse 开放开发者接入 — testingcatalog · 2026-09-19
- Jev 只输出打分/真假:一类「反直觉」的小型 LLM 用法 — Babayaga1664 · 2026-09-19
- Reddit 网友魔改 llama.cpp:双卡异构跑 Qwen3 27B 至 262k 上下文 — comperr · 2026-09-19
- Tobi 谈 Jev 之争:判别式模型难做通用分类器 — caglar_ee · 2026-09-19
- 隐藏测试+代码评审基准实测:Sonnet 5 得 95.0 力压 Opus 4.6 — Short_Regular_7191 · 2026-09-19
- AgentSky 上线:浏览器免装调用 40+ 编码 Agent 可横向比价 — Aiden_Tech_Ai · 2026-09-19