DeepSeek V4 Flash 登榜 ARC-AGI,最高得分 89%
teortaxesTex · x · 2026-08-09
DeepSeek V4 Flash 0731 版本在 ARC-AGI 基准测试中取得了显著成绩。在最高推理算力下,该模型在 ARC-AGI-1 半私有测试集中获得 89.0% 的准确率(单任务成本 0.02 美元),并在 ARC-AGI-2 半私有测试集中获得 61.4%(单任务成本 0.04 美元)。原推文作者感叹,考虑到模型迭代速度,等 ARC-AGI-3 这种高算力评估跑完时,被测模型可能早就已经过时了。
所属事件:DeepSeek V4 Flash登顶ARC-AGI性价比,成本仅GPT-5.6四分之一(9 条相关)→
「模型」频道最新
- Astra 两月未支持多模型?网友质疑宣传 — teortaxesTex · 2026-08-26
- 观点:模型发展至今,推理速度比模型大小更重要 — natesiggard · 2026-08-26
- Tiel-Coder-35B 模型:本地推理速度达 121.4 tok/s — DerTomsn · 2026-08-26
- Qwen 35B-A3B 变体模型 Tool Calling 能力横评 — OsmanthusBloom · 2026-08-26
- Grok 4.6 现已登陆 OpenCode Go — veggie_eric · 2026-08-26
- 100 美元 Claude 套餐跑一个设计任务就用到 95% 额度 — zeeg · 2026-08-26