只输出概率的 Jev 模型实测:49 项任务中 42 项追平 GPT-5.6

TypeSafe 推出的 Jev 是一个不生成文本、仅对「是/否、多选、打分」等类型化问题输出概率的模型。有博主在 49 个任务、约 8200 条数据(涵盖 SST-2、MMLU 等)上实测,发现 Jev 在 42 项任务中追平或超过 GPT-5.6-luna。不过 @whereischarly 认为将其与 LLM 直接比较意义不大——Jev 本就不是 LLM,速度快是理所当然的,他转而将其与 Hugging Face 上的其他判定模型对比,发现 Jev 准确率胜出,却在速度上落败。

2026-09-19 ~ 2026-09-19 · 3 条相关

事件全程(共 9 集)→

另有 1 条近重复转述:LowNefariousness9966