Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开

whiteh4cker · reddit · 2026-09-11

Reddit 用户 whiteh4cker 分享用 2×RTX 3090(Windows 11、192GB DDR5)在 llama.cpp 的 FlashNext 分支上本地运行 Qwen3.8 Flash Next UD-Q4KXL 的实测结果:生成速度从主分支的 20 t/s 提升到 49 t/s,提示处理约 140 t/s(提示处理主分支更快)。

帖子给出了完整的复现细节:

对想在本地跑最新 MoE 模型并压榨多卡速度的人,这是一份可直接照抄的配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →