DeepSeek V4.1 Flash 登 ARC-AGI-2 72.9%,单任务成本涨 250%
teortaxesTex · x · 2026-10-07
ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI(Verified)上的成绩:ARC-AGI-2 达 72.9%($0.13/任务),ARC-AGI-1 达 94.5%($0.07/任务)。
相比 V4 Flash 的最好成绩,V4.1 Flash 在 ARC-AGI-1 高出 5.5 分、ARC-AGI-2 高出 11.5 分,但单任务成本约贵 250%。
评论者 teortaxesTex 指出两点:一是成绩未超过此前更小的 Dots3-preview(性能和成本都不及),略让人失望;二是他认为这有力验证了 DeepSeek 的 RL 训练方案,呼吁更多关注。
「模型」频道最新
- 「Astra 暂停综合征」刷屏:steering 或致模型沉默,OpenAI 有解法 — thursdai_pod · 2026-10-07
- 网传 Qwen4 Flash 疑为 400B 参数,规模对标 GLM 5.3 Flash — EAccelerate_42 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- Mistral Large 4.0 万亿参数开源权重月底发布 — cpldcpu · 2026-10-07
- Claude 以「推理抽取」为由拒绝展示思考过程,用户吐槽:推理才是好东西 — StewartalsopIII · 2026-10-07
- 网友吐槽 Grok 性格拧巴:先说 No 再替你把论证讲得更强 — gandamu_ml · 2026-10-07