Qwen3.8-Flash在DGX Spark上的量化优化配方:int4量化+RDMA,代码47.5t/s
Saren-WTAKO · reddit · 2026-08-31
作者分享了在单块GB10/DGX Spark上运行Qwen3.8-Flash的配方,使用Intel AutoRound int4量化、vLLM,并将fp8 ngram表卸载到本地SSD或外部RDMA服务器。提供了详细的性能数据:代码生成约47.5t/s,JSON约60t/s,并讨论了MTP带来的额外TTFT问题。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01