双 5090 跑通 Qwen 100 万上下文,实测数据披露
Littlepharaoh · reddit · 2026-08-30
作者 fork 了 NInfer 引擎并实现了双 GPU 张量并行和 YaRN 扩展,成功在两张 5090 上运行 Qwen2.5-72B (原文可能有误,按内容推断为 27B) 的 100 万 token 上下文。
关键数据(500W/GPU 功耗限制):
- 解码速度:在 65.3k 上下文时,开启 MTP 推测解码达 119 tok/s,关闭则 57 tok/s(同配置 vLLM 仅 42 tok/s)。
- 长文本表现:vLLM 在超过原生 262k 窗口后 MTP 接受率降为 0,而 NInfer 在 100 万 tokens 时仍保持 55-60% 接受率。
- Prefill:vLLM 预填充速度是 NInfer 的 1.2-1.3 倍,100 万 tokens 填充需约 18 分钟。
- 显存:vLLM 的 fp8 KV cache 仅支持约 75.9k tokens,NInfer 的 INT8 KV 完整容纳 100 万 tokens。
「Infra」频道最新
- Zoubin Ghahramani:数据中心本质上是将电力转化为可用的智能 — irinarish · 2026-08-30
- Enter Cloud 提供全栈式开发基础设施 — FellMentKE · 2026-08-30
- Applied Compute 发布 AC2 私测版:打造模型工厂基础设施 — ypatil125 · 2026-08-30
- 背景移除模型因 lazy load 导致重复加载 — Acceptable-Work8202 · 2026-08-30
- Gemma 4 26B MLX 优化竞赛:48 小时性能提升接近 100% — gajesh · 2026-08-30
- 中国人形机器人占全球出货 86%,英伟达复制 CUDA 策略入局 — rohanpaul_ai · 2026-08-30