专题 · FULL STORY
DeepSeek-V4-Flash:跑分曝光到流量暴涨
DeepSeek-V4-Flash 单机基准结果流出后,斯坦福开源自验证框架助其在评测中反超 Claude,随后用量激增,两周日 Token 处理量从 3T 增至 18T,成为增长最快的开源模型之一。
2026-08-19 ~ 2026-08-21 · 3 集 · 7 条
第 1 集 · DeepSeek-V4-Flash 跑分曝光,单机吞吐最高 4550 tok/s(2026-08-19,2 条)
DeepSeek-V4-Flash 在单台 DGX Station GB300 上的基准测试结果流出。数据显示单流吞吐量约 261 至 286 tok/s,32 并发下可达约 4,550 tok/s;另一开发者 MrCatid 的实测也给出类似数字:使用 DFlash 技术时单会话 261 tok/s,批处理吞吐达 1,479 tok/s,投机解码则带来约 34% 的提速。
- DeepSeek-V4-Flash 跑分曝光:单机 286 tok/s,投机解码提速 34% — mcraddock · 2026-08-19
- DS4F 推理实测:单会话 261 tokens/s,批处理达 1479 tokens/s — antirez · 2026-08-19
第 2 集 · 斯坦福开源框架助 DeepSeek V4 Flash 反超 Claude(2026-08-20,2 条)
斯坦福团队为 DeepSeek V4 Flash 推出开源验证框架,通过先生成 5 套方案再以同一模型作为 LLM-as-a-Judge 排序筛选最优解的自验证机制,将其在 Terminal-Bench 2.1 上的准确率从 79% 进一步提升,成功反超 Claude,而成本仅为后者的约 1/11,展示了推理时采样与自评策略的性价比。
- 斯坦福框架助 DeepSeek 超越 Claude,成本仅 1/11 — FuSheng_0306 · 2026-08-20
- DeepSeek V4 Flash 靠自验证击败 Claude — nptacek · 2026-08-21
第 3 集 · DeepSeek Flash 用量激增,两周 Token 流量涨 6 倍(2026-08-21,3 条)
DeepSeek v4 Flash 自 8 月 1 日发布以来热度飙升,两周内日处理 Token 量从 3T 增至 18T,增长 6 倍,几乎翻倍了 OpenRouter 的日总量,并在开源模型加速榜上位居第一。驱动因素是其极低甚至近乎零成本的单次推理价格,使其成为首轮推理的首选。值得注意的是,增长不仅来自个人开发者,企业级用量也显著上升,部分场景增幅达 10 至 100 倍。
- DeepSeek Flash 需量激增百倍,因推理极廉 — bindureddy · 2026-08-21
- DeepSeek Flash 霸榜开源加速,成本极低企业级用量飙升百倍 — bindureddy · 2026-08-21
- DeepSeek v4 Flash 两周流量暴增 6 倍,极致性价比驱动 — teortaxesTex · 2026-08-21