4×5060 Ti 跑 Qwen3.8 Flash Next 仅 15 t/s,内存带宽成瓶颈?
Ambitious_Fold_2874 · reddit · 2026-09-12
- 发帖人在 4 张 5060 Ti 16GB(quad-channel DDR4 平台)上用 Unsloth Studio 跑 Qwen3.8-Flash-Next Q80 GGUF,仅得到 15 t/s 生成、90 t/s 预填充,远低于预期。
- llama.cpp 直接跑会报错,只能换 Unsloth Studio;附带了完整的 llama-server 启动命令:加载 unsloth/Qwen3.8-Flash-Next-GGUF:Q80,挂载 MTP draft 模型做 speculative decoding(--spec-type draft-mtp,最多 3 草稿),KV cache 量化 q80,上下文 256K。
- 推测 quad-channel DDR4 的内存带宽是主要瓶颈,对想在多卡消费级平台跑新模型的用户是有参考价值的踩坑记录。
「Infra」频道最新
- Agent 的隐性成本在 KV cache:DeepSeek 压到每 token 约 890 字节 — altryne · 2026-09-12
- 约 3157 美元搭双 3090 推理机:Qwen3 27B 跑出 70 tps — Puzzleheaded_Ad_8575 · 2026-09-12
- AMD 上线 DeepSeek v4.1 Flash 镜像,每美元性能最高落后 B200 达 42 倍 — IanAndrewsDC · 2026-09-12
- Hot Chips 2026:OpenAI Jalapeno 推理加速器架构拆解 — bookwormengr · 2026-09-12
- h3 studio:Mac 上原生 Metal 跑 MiniMax-H3 视频生成,模型常驻免重载 — janishar · 2026-09-12
- 公司转向 agent 架构后:API 调用若走 Sonnet 5 每天要烧一两千美元 — nunodonato · 2026-09-12