替换 top-k 回退实现,双 3090 跑 Qwen 长上下文解码提速 9–12%
Extension-Bid-639 · reddit · 2026-09-08
作者更新了在双 RTX 3090 上运行 Qwen3 Flash-Next(专家缓存 + MTP)的实测:将稀疏注意力索引器中回退到整行排序的 CUDA top-k 实现,替换为 llama.cpp 已有的 radix-selection 逻辑(对应上游 PR #28366,作者未重复开 PR)。top-k 核单 token 耗时从约 5.1ms 降到 0.25ms。
测试配置:2x RTX 3090、双 Xeon E5-2696 v4、128GB DDR4、UD-Q4KXL 量化、f16 KV、150 个专家缓存槽、MTP-3、分配 261,888 token 上下文,长文档测试起点约 119k token。三个种子的中位解码速度从 30.2–30.4 t/s 提升到 33.1–33.7 t/s,即每种子中位吞吐提升 9–12%。
质量筛查覆盖 80 个问题/深度组合 × 3 种子,共 480 请求、240 组配对比较:对照组 235/240 正确,实验组 238/240,作者认为这只能证明没有质量回退,不能证明质量更好。该改动已进入作者的生产构建;prefill 与关闭 MTP 场景的收益尚未测量。建议使用旧版 CUDA 工具链跑 Flash-Next 的用户检查自己的 top-k 回退路径。
「Infra」频道最新
- FT: CXMT 与长存已囤足三年扩产所需 ASML DUV 光刻机 — basedjensen · 2026-09-08
- 英伟达单季净利 597 亿美元,超过 12 家标志性公司总和 — FinanceYF5 · 2026-09-08
- 四个小模型合并进一台推理服务器,doc-QA agent 运维负担大减 — Sad-Razzmatazz-7657 · 2026-09-08
- 华为昇腾登台 PyTorch 中国大会:从硬件适配走向联合标准研究 — PyTorch · 2026-09-08
- AUR llama.cpp-cuda 包被删后性能暴跌 90%,网友自行编译找回 — MrHall · 2026-09-08
- UHP 激光器系列第三篇:MOPA 方案对比 Lumentum 路线 — vikramskr · 2026-09-08