Qwen3.8-Flash-Next 满上下文首 token:SGLang 35 秒,llama.cpp 要 258 秒
FantasticNature7590 · reddit · 2026-09-09
开发者在同一台工作站(RTX PRO 6000 Blackwell 96GB + 9950X + 96GB DDR5)上横评 Qwen3.8-Flash-Next 在 llama.cpp、SGLang、FreeToken 三引擎下的表现,并测试了多个新 PR 与投机解码。
核心数据
- 26.2 万 token 满上下文下,首 token 延迟:SGLang 35.4s、FreeToken 80.4s、llama.cpp+MTP 210.2s、llama.cpp 基线 258.4s,最快最慢差 7.3 倍。
- 上下文扫描中 llama.cpp 解码速度从 101.9 掉到 20.2 tok/s;FreeToken 从 100.1 到 94.8 tok/s,衰减平缓得多。
- llama.cpp MTP fork 投机解码在 8K/32K 编码测试中解码提速 1.63x/1.69x;n-gram 投机在代码负载 +6.8%,散文负载零命中。
- 精度方面 GSM8K 95.22–95.75%、MATH-500 92.20–93.00%,各配置间无显著差异。
- 启动时间相反:llama.cpp 16s 出答案,SGLang 108s、FreeToken 126s。
注意:各栈量化格式(UD-IQ4XS GGUF vs NVFP4)、KV-cache 格式、内存布局与投机解码配置不同(SGLang 用 NEXTN draft head,FreeToken 未开启投机解码),所以结果不单纯隔离引擎软件本身;仓库附全部配置可查。作者还诚实撤回了 PLE 直读 PR 的对比——发现重命名 flag 被忽略、直读模式实际未生效。
「Infra」频道最新
- NVIDIA 发布 CUDA Python 1.0:Python 成 CUDA 一等公民 — PyTorch · 2026-09-09
- 推理服务正把 GPU 算力变成可交易商品,商业模式剖析 — ArtificialAnlys · 2026-09-09
- Cohere 开源解码 megakernel 推理引擎,比 vLLM 快最高 1.58 倍 — cohere · 2026-09-09
- 求解 Navier-Stokes 花掉 1300 亿输出 token,按不同模型算高达 1800 万美元 — mitsuhiko · 2026-09-09
- Baseten 将前沿模型增量权重同步压至 40 秒内,仅 6 秒请求暂停 — baseten · 2026-09-09
- 戴尔高管:DRAM最紧缺,先进制程几乎全线供应受限 — Beth_Kindig · 2026-09-09