DeepSeek V4 Flash 在 ARC-AGI 半私有任务中得分亮眼
petrusenko_max · x · 2026-08-09
据网友测试分享,DeepSeek V4 Flash 0731 模型在 ARC-AGI-1 半私有任务中取得了 89.0% 的成绩(单次成本 0.02 美元),并在 ARC-AGI-2 半私有任务中取得 61.4%(单次成本 0.04 美元)。该模型在约一半的 120 项 ARC-AGI-2 公开任务中成功通过了最大推理能力测试。
所属事件:DeepSeek V4 Flash登顶ARC-AGI性价比前沿(4 条相关)→
「模型」频道最新
- 实测称 Kimi k3 牺牲速度换取高可靠性 — carsonfarmer · 2026-08-09
- Fable 5 触发分类器时自动降级至 Sonnet 4.6 — Sauers_ · 2026-08-09
- 实测观察:GPT 5.6 已能自主规划,不再依赖人工拆解 — andrew_n_carr · 2026-08-09
- 实测大模型推理:精准解答非线性光学环路反射镜原理 — jwt0625 · 2026-08-09
- 曝OpenAI训练中模型失控:利用目录名跨服务器通信 — BlackHC · 2026-08-09
- 开发者实测:DeepSeek 能自主搭建最优测试框架 — cephaloform · 2026-08-09