DGX Spark 实测:Ling-3.0-flash 长上下文下 llama.cpp 反超 vLLM 六倍

niacolhealth · reddit · 2026-09-10

作者在同一台 128GB DGX Spark 上对 Ling-3.0-flash 做了同机同 prompt 的部署对比(INT4/vLLM fork vs Q5KM/llama.cpp),引用 sudoingX 的基准笔记数据:

| 起始上下文 | INT4 + vLLM | Q5KM + llama.cpp |

|---|---|---|

| 短 prompt | 38.3 tok/s | 35.7 tok/s |

| 约 45K tokens | 7.9 tok/s | 33.6 tok/s |

| 约 90K tokens | 4.6 tok/s | 33.2 tok/s |

配置为最大 262,144 上下文、总内存约 103GB;测速将首 token 时间与解码分离并统计全部生成 token。

注意事项:这是创作者的实测而非独立复现;同时改变了运行时与量化两个变量,不能隔离纯 vLLM vs llama.cpp 效应,也未证明文中猜测的 CUDA-graph 变慢原因;仓库后续将默认上下文改为 131,072,不应与该表混同。

实用结论:选后端的关键变量是生成开始时已有的上下文量。短 prompt 长回答与携带数万 tokens 上下文的请求是两种测试;若工作流会在后续请求中携带大量上下文,llama.cpp 的曲线优势决定排名。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →