DeepSeek V4.1 Flash 被指遭评测社区冷落,ARC-AGI 与数学竞技场均缺席
teortaxesTex · x · 2026-09-16
有网友吐槽 DeepSeek V4.1 Flash 是「重要性与评测社区关注度差距最大」的模型:ARC-AGI、数学竞技场、WeirdML 等热门评测都没跑,「0.1 flash」式的小版本号让它看起来不像大新闻,加上 Artificial Analysis 分数平平,社区兴趣寥寥。作者对此表示失望。这条帖子反映了小版本更新在评测驱动话语体系下容易被忽视的现象。
「模型」频道最新
- AI 智能体「玩 Doom」被拆穿:输入全游戏状态文本,30 行代码就能实现 — banteg · 2026-09-16
- 爆料称「大发布周」临近,GPT-6 Sol 及系列小模型或在酝酿 — Winter-Mix-5155 · 2026-09-16
- Altman:GPT 5.5 相当于普通数学教授,内部模型超越全球顶尖数学家 — acoolrandomusername · 2026-09-16
- ChatGPT 桌面端翻车:强制展示已归档/已删除会话 — ___Patrice___ · 2026-09-16
- closed labs 加码生命科学数据,GPT-Rosalind 成 OpenAI 新多头论据 — xeophon · 2026-09-16
- GLiNER 作者回应:零样本 NER 模型被低估,正迈向端到端 RL — bclavie · 2026-09-16