Qwen3.8-Flash-Next 满上下文首 token:SGLang 35 秒,llama.cpp 要 258 秒

FantasticNature7590 · reddit · 2026-09-09

开发者在同一台工作站(RTX PRO 6000 Blackwell 96GB + 9950X + 96GB DDR5)上横评 Qwen3.8-Flash-Next 在 llama.cpp、SGLang、FreeToken 三引擎下的表现,并测试了多个新 PR 与投机解码。

核心数据

注意:各栈量化格式(UD-IQ4XS GGUF vs NVFP4)、KV-cache 格式、内存布局与投机解码配置不同(SGLang 用 NEXTN draft head,FreeToken 未开启投机解码),所以结果不单纯隔离引擎软件本身;仓库附全部配置可查。作者还诚实撤回了 PLE 直读 PR 的对比——发现重命名 flag 被忽略、直读模式实际未生效。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →