替换 top-k 回退实现,双 3090 跑 Qwen 长上下文解码提速 9–12%

Extension-Bid-639 · reddit · 2026-09-08

作者更新了在双 RTX 3090 上运行 Qwen3 Flash-Next(专家缓存 + MTP)的实测:将稀疏注意力索引器中回退到整行排序的 CUDA top-k 实现,替换为 llama.cpp 已有的 radix-selection 逻辑(对应上游 PR #28366,作者未重复开 PR)。top-k 核单 token 耗时从约 5.1ms 降到 0.25ms。

测试配置:2x RTX 3090、双 Xeon E5-2696 v4、128GB DDR4、UD-Q4KXL 量化、f16 KV、150 个专家缓存槽、MTP-3、分配 261,888 token 上下文,长文档测试起点约 119k token。三个种子的中位解码速度从 30.2–30.4 t/s 提升到 33.1–33.7 t/s,即每种子中位吞吐提升 9–12%。

质量筛查覆盖 80 个问题/深度组合 × 3 种子,共 480 请求、240 组配对比较:对照组 235/240 正确,实验组 238/240,作者认为这只能证明没有质量回退,不能证明质量更好。该改动已进入作者的生产构建;prefill 与关闭 MTP 场景的收益尚未测量。建议使用旧版 CUDA 工具链跑 Flash-Next 的用户检查自己的 top-k 回退路径。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →