Deepseek V4 Flash 刷新纪录:单流解码达 420 tok/s
HankYeomans · x · 2026-08-27
社区成员通过特定配置实现了 Deepseek V4 Flash 模型的高吞吐量推理。
- 性能突破:单流解码速度达到 420 tokens/s,打破了此前 357.9 tok/s 的社区记录。
- 优化手段:通过调整两个变量并对内存进行 6000MHz 超频,作者甚至达到了 446.4 tok/s 的峰值速度。
- 技术细节:使用了 TP=4 (Tensor Parallelism=4) 配置,并关闭了 prefill 阶段以专注于解码性能测试。
「模型」频道最新
- 实测:Codex 用量几乎无限,远比 Fable 划算 — panickssery · 2026-08-27
- Qwen 与 GLM 推出低成本高速模型 — brandon_galang · 2026-08-27
- 用户纠正关于 Qwen3.8-27B 模型排名的误传信息 — Real-C- · 2026-08-27
- 爆料称 Sonnet 和 Opus 模型即将发布 — ChrisGPT · 2026-08-27
- AMD R9700 单卡跑 Qwen3.8-27B 达 227 tok/s,无损加速新纪录 — samsja19 · 2026-08-27
- 爆料:Anthropic 拟先发 Fable 5.1,Astra 仍未就位 — haider1 · 2026-08-27