6 卡 3090 无 NVLink 跑 Qwen3.8-Flash-Next:prefill 快 8-10 倍,长文解码快 2-3 倍

flynth92 · reddit · 2026-10-08

作者在 6 张 3090(纯 PCIe,部分仅 x4/x2 通道)上跑 Qwen3.8-Flash-Next,5 个会话各 262k 上下文,针对 llama.cpp 长上下文性能劣化问题打了一系列补丁,发布 llama.cpp-multigpu 性能分支(tarball 与 ghcr 镜像,同 GGUF、同 llama-server,环境变量开启)。

核心数据(upstream → patched):

注意事项:仅测试了一个模型、仅 CUDA、为慢速 PCIe 编写,开多 GPU 开关可能影响 NVLink/单卡场景;代码由 LLM 编写、靠测试与输出校验验证,故未向上游提 PR,但每个改动独立 commit 可单独取用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →