DGX Spark 实测:Ling-3.0-flash 长上下文下 llama.cpp 反超 vLLM 六倍
niacolhealth · reddit · 2026-09-10
作者在同一台 128GB DGX Spark 上对 Ling-3.0-flash 做了同机同 prompt 的部署对比(INT4/vLLM fork vs Q5KM/llama.cpp),引用 sudoingX 的基准笔记数据:
| 起始上下文 | INT4 + vLLM | Q5KM + llama.cpp |
|---|---|---|
| 短 prompt | 38.3 tok/s | 35.7 tok/s |
| 约 45K tokens | 7.9 tok/s | 33.6 tok/s |
| 约 90K tokens | 4.6 tok/s | 33.2 tok/s |
配置为最大 262,144 上下文、总内存约 103GB;测速将首 token 时间与解码分离并统计全部生成 token。
注意事项:这是创作者的实测而非独立复现;同时改变了运行时与量化两个变量,不能隔离纯 vLLM vs llama.cpp 效应,也未证明文中猜测的 CUDA-graph 变慢原因;仓库后续将默认上下文改为 131,072,不应与该表混同。
实用结论:选后端的关键变量是生成开始时已有的上下文量。短 prompt 长回答与携带数万 tokens 上下文的请求是两种测试;若工作流会在后续请求中携带大量上下文,llama.cpp 的曲线优势决定排名。
「Infra」频道最新
- Boring Company 融资 30 亿美元,估值 230 亿转向全球基建 — XFreeze · 2026-09-10
- 华为昇腾 950DT 涨价 20%-50%,黑市 HBM 更贵数倍 — teortaxesTex · 2026-09-10
- Google 签 22 年协议包下芬兰核电站一半出力,总额 130 亿欧元投资 — Servola-Journal · 2026-09-10
- GPU 稀缺真正痛点:算力被当 3 年期整块期货卖 — kevinakwok · 2026-09-10
- 印度数据中心将扩至 6GW,西孟加拉邦拟开放 18 个工业园用地 — HimanshiET · 2026-09-10
- vLLM 推理技术 meetup 落地班加罗尔,AMD/Red Hat 联办 — dhruv2038 · 2026-09-10