专题 · FULL STORY

DeepSeek-V4-Flash:跑分曝光到流量暴涨

DeepSeek-V4-Flash 单机基准结果流出后,斯坦福开源自验证框架助其在评测中反超 Claude,随后用量激增,两周日 Token 处理量从 3T 增至 18T,成为增长最快的开源模型之一。

2026-08-19 ~ 2026-08-21 · 3 集 · 7 条

第 1 集 · DeepSeek-V4-Flash 跑分曝光,单机吞吐最高 4550 tok/s(2026-08-19,2 条)

DeepSeek-V4-Flash 在单台 DGX Station GB300 上的基准测试结果流出。数据显示单流吞吐量约 261 至 286 tok/s,32 并发下可达约 4,550 tok/s;另一开发者 MrCatid 的实测也给出类似数字:使用 DFlash 技术时单会话 261 tok/s,批处理吞吐达 1,479 tok/s,投机解码则带来约 34% 的提速。

第 2 集 · 斯坦福开源框架助 DeepSeek V4 Flash 反超 Claude(2026-08-20,2 条)

斯坦福团队为 DeepSeek V4 Flash 推出开源验证框架,通过先生成 5 套方案再以同一模型作为 LLM-as-a-Judge 排序筛选最优解的自验证机制,将其在 Terminal-Bench 2.1 上的准确率从 79% 进一步提升,成功反超 Claude,而成本仅为后者的约 1/11,展示了推理时采样与自评策略的性价比。

第 3 集 · DeepSeek Flash 用量激增,两周 Token 流量涨 6 倍(2026-08-21,3 条)

DeepSeek v4 Flash 自 8 月 1 日发布以来热度飙升,两周内日处理 Token 量从 3T 增至 18T,增长 6 倍,几乎翻倍了 OpenRouter 的日总量,并在开源模型加速榜上位居第一。驱动因素是其极低甚至近乎零成本的单次推理价格,使其成为首轮推理的首选。值得注意的是,增长不仅来自个人开发者,企业级用量也显著上升,部分场景增幅达 10 至 100 倍。