DeepSeek v4 单卡跑出 47 tok/s,通过 37 万针测

EAccelerate_42 · x · 2026-08-21

DeepSeek v4 Flash 0731 模型已优化至可在单台 DGX Spark 设备上流畅运行。该配置使用 EXL3 量化技术,在单流会话中实现了 47 tok/s 的生成速度和 1024 tok/s 的预填充速度,并通过了 37 万 token 的针测试。性能得益于原生的 NVFP4 KV 缓存支持,质量与 Q4KM / Q5 GGUF 相当。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →