DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照
frappuccinoCoin · reddit · 2026-09-22
Reddit 帖介绍 Jev 与 DeepSeek 在 jevals.com 基准上的对比。Jev 被定义为「System One」模型:不输出文本,只对每个选项给出概率;基准同时考察答案正确性与概率的诚实度(calibration)。LLM 也能做这类任务,但需要要求输出概率并关掉推理,属于「让鱼爬树」。结果显示 DeepSeek 在选择题任务上表现不错:准确率略低于 Jev、更慢更贵,但是榜单上校准(calibration)最好的模型。
所属事件:Jev 无文本模型基准对比:决策占比高但校准落后 Gemini 与 DeepSeek(2 条相关)→
「模型」频道最新
- 训练 30 步路由即崩?博主热议某团队罕见披露数据配比 — stochasticchasm · 2026-09-22
- Grok 4.7 Fast 被曝同模型双倍计价,仅限 Cursor 等渠道 — Daniel_Farinax · 2026-09-22
- async 4 罕见公开训练数据配比,评论者称 30 步全跑完表现意外 — stochasticchasm · 2026-09-22
- Grok 4.7 传已发布:为 Grok Bot 训练的全任务智能体模型 — elonmusk · 2026-09-22
- Grok 4.7 发布:同价同速下较 4.6 显著提升 — Saboo_Shubham_ · 2026-09-22
- 质疑 OpenAI 数学评测口径:解决 100 难题却不说尝试了多少道 — burny_tech · 2026-09-22