6 卡 3090 无 NVLink 跑 Qwen3.8-Flash-Next:prefill 快 8-10 倍,长文解码快 2-3 倍
flynth92 · reddit · 2026-10-08
作者在 6 张 3090(纯 PCIe,部分仅 x4/x2 通道)上跑 Qwen3.8-Flash-Next,5 个会话各 262k 上下文,针对 llama.cpp 长上下文性能劣化问题打了一系列补丁,发布 llama.cpp-multigpu 性能分支(tarball 与 ghcr 镜像,同 GGUF、同 llama-server,环境变量开启)。
核心数据(upstream → patched):
- prefill 250k 单会话:6x3090 从 263→2111 t/s(8 倍);6x4090 从 744→7403 t/s(10 倍)
- 单会话 250k 解码:3090 上 10.2→33.7 t/s;4090 上 21.0→48.7 t/s
- 5 会话并发每路解码 3090:2.3→27.3 t/s(10.8 倍,注意基线很低)
- 关键是形状:补丁后 prefill 从 5k 到 250k 几乎持平,解码几乎不掉;upstream 每 50k 左右减半
- n-gram lookup 投机解码:代码改写/重构 2-2.5 倍,代码解释 1.5 倍,散文无效,>2 并发用户时自动关闭
- MTP 在此机器上试过反而更慢,未包含
注意事项:仅测试了一个模型、仅 CUDA、为慢速 PCIe 编写,开多 GPU 开关可能影响 NVLink/单卡场景;代码由 LLM 编写、靠测试与输出校验验证,故未向上游提 PR,但每个改动独立 commit 可单独取用。
「Infra」频道最新
- Surface AI 硬件周五开售:RTX Spark 版起售 2599 美元,Dev Box 5999 美元 — ryanshrout · 2026-10-08
- XPU Grasshopper 芯片宣称由 AI 协同设计,13 周性能提升 816 倍 — ycombinator · 2026-10-08
- 机密估算显示 NSA 每年花费数十亿美元测试前沿 AI 模型 — coherence · 2026-10-08
- 为省一微分钱,超大规模云厂商在可插拔光模块上有多拼 — jwt0625 · 2026-10-08
- 128GB Mac 跑 341GB DeepSeek:砍代码库让 agent 提速 2 倍 — Chida82 · 2026-10-08
- Windows 现场 demo:编码任务被自动路由到本地模型,llama.cpp 已接入 Windows ML — ryanshrout · 2026-10-08