Qwen3.8-Flash在DGX Spark上的量化优化配方:int4量化+RDMA,代码47.5t/s

Saren-WTAKO · reddit · 2026-08-31

作者分享了在单块GB10/DGX Spark上运行Qwen3.8-Flash的配方,使用Intel AutoRound int4量化、vLLM,并将fp8 ngram表卸载到本地SSD或外部RDMA服务器。提供了详细的性能数据:代码生成约47.5t/s,JSON约60t/s,并讨论了MTP带来的额外TTFT问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →