只出概率的 Jev 模型实测:49 项任务中 42 项追平或超过 GPT-5.6-luna

LowNefariousness9966 · reddit · 2026-09-19

博主拿到 TypeSafe 的 Jev——一个不生成文本、只对「是/否、多选、打分」类类型化问题输出概率的模型——并在 49 个任务、约 8200 条数据(SST-2、MMLU、ARC、MS MARCO、XNLI、SQuAD、Banking77 等)上与 gpt-5.6-luna 对比:

主要结果

劣势

作者注明基准污染风险(自建数学题是唯一对照)、基线刻意限制为无/低推理、每任务 200 条使 <0.05 差异属噪声,且 Jev 不能写文本/调工具/解释自己——它替代的不是 LLM 本身,而是围绕 LLM 的小分类器、重排器和相关性判断调用。任务构建器、跑分脚本、原始结果均已开源(stdlib-only Python)。

所属事件:只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →