Bittensor 挖矿优化被 vLLM 收编,Qwen3 吞吐提升约 4%
const_reborn · x · 2026-09-17
Pareton 在 Bittensor SN10 上跑 Qwen 激励活动时,矿工发现的一项推理优化已被 vLLM 项目合并(PR #57140)。
- 优化内容:针对 Qwen3 GDN 架构的 MTP 投机解码,混合投机/非投机 batch 不再额外分配 mergedout 张量再整体拷贝,而是直接 scatter 到调用方缓冲区,省掉一次输出大小的内存分配和一次全量拷贝。
- 效果:batch 4–8 场景下 Qwen3.8 吞吐提升约 4%,同时保持 token 顺序、缓冲区别名和 padding 行为不变。
- 作者以此为例宣传开放竞争机制下矿工优化能回流开源社区的叙事。
「Infra」频道最新
- llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解 — Ambitious_Fold_2874 · 2026-09-17
- 预测:18个月内Kimi K3级智能将跑在单张RTX 5090上 — TheZachMueller · 2026-09-17
- 有用户称愿为 AI 订阅月付 1000 美元,但定价过高会推向本地部署 — draginol · 2026-09-17
- 腾讯开源 FlexKV 分布式 KV 缓存:TTFT 最高降 70%,吞吐提升 16% — Roger_M_Taylor · 2026-09-17
- NVIDIA 上架 DeepSeek-V4.1-Flash NVFP4 量化版,MIT 协议开源 — TheZachMueller · 2026-09-17
- vLLM 出现 DiffusionGemma 结构化生成 PR,单机 DGX Spark 延迟亮眼 — generativist · 2026-09-17