单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方

DimeRhyme · reddit · 2026-09-29

结果

作者在单台 DGX Spark(GB10)上给出 Qwen3.8 Flash 的 vLLM serving 配方,全部开源:

关键优化点

资源占用

模型约 71 GiB,KV pool 16 GB,负载下仍余约 16 GiB;生成时 GPU 中位功耗 35-37W。作者指出这些技巧大多适用于任何 MTP/speculative decoding 部署。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →