DeepSeek V4.1 智能体编码大增,部分高分基准反而退步

teortaxesTex · x · 2026-09-17

关于 DeepSeek V4.1 的早期观察(注:原文为网友讨论,未证实):- 智能体/编码任务上大幅超越 V4 系列;- 体积比 V4 Flash 大不少;- 但在一些「高信号」基准上持平甚至退步,包括 MathArena、CritPt 等;- ARC-2 成绩被期待作为更可靠的判断依据。另一开发者称资金耗尽前简单测过,觉得与 DeepSeek V4 Flash 差不多,没有继续跟进。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →