DeepSeek V4.1 智能体编码大增,部分高分基准反而退步
teortaxesTex · x · 2026-09-17
关于 DeepSeek V4.1 的早期观察(注:原文为网友讨论,未证实):- 智能体/编码任务上大幅超越 V4 系列;- 体积比 V4 Flash 大不少;- 但在一些「高信号」基准上持平甚至退步,包括 MathArena、CritPt 等;- ARC-2 成绩被期待作为更可靠的判断依据。另一开发者称资金耗尽前简单测过,觉得与 DeepSeek V4 Flash 差不多,没有继续跟进。
「模型」频道最新
- Jev 走红背后:许多人不知道 encoder-only 分类器早已成熟 — RichmanRonald · 2026-09-17
- 曝 X 将强制绑定 Grok 账号,才能继续用站内 Grok — nima_owji · 2026-09-17
- 实测 OpenRouter 匿名模型 union-alpha:还停在 three.js r127,不像是旗舰 — karminski3 · 2026-09-17
- 博主实测 OpenRouter 匿名模型 union-alpha:不像 2026 旗舰 — karminski3 · 2026-09-17
- Stevesi:剥离拟人化话术,模型失准本质上就是 Bug — ylecun · 2026-09-17
- Grok Bot 日活 5 天涨 80%,从 6.7 万冲至 12.1 万 — FinanceYF5 · 2026-09-17