DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照

frappuccinoCoin · reddit · 2026-09-22

Reddit 帖介绍 Jev 与 DeepSeek 在 jevals.com 基准上的对比。Jev 被定义为「System One」模型:不输出文本,只对每个选项给出概率;基准同时考察答案正确性与概率的诚实度(calibration)。LLM 也能做这类任务,但需要要求输出概率并关掉推理,属于「让鱼爬树」。结果显示 DeepSeek 在选择题任务上表现不错:准确率略低于 Jev、更慢更贵,但是榜单上校准(calibration)最好的模型。

所属事件:Jev 无文本模型基准对比:决策占比高但校准落后 Gemini 与 DeepSeek(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →