双 3090 跑 Qwen3.8 Flash Next:llama.cpp 配置求调优,附完整参数
ChopSticksPlease · reddit · 2026-09-12
作者分享在双 RTX 3090(48GB 显存)+ 128GB DDR4 + 40核 Xeon(Proxmox 虚拟机、PCIe 直通、NUMA 绑定)上跑 Qwen3.8 Flash Next 的 llama.cpp 配置,并征求改进建议。
当前成绩:PP 130-200 tps(疑似 CPU 瓶颈)、TG 约 14-22 tps(平均约15)。关键参数包括 131072 上下文、q80 KV cache、flash-attn、-ts 26,10 层分配、-ncmoe 26、perlayertokenembd=CPU 张量覆盖等,手动调参以避免崩溃。
「Infra」频道最新
- TensorSharp 在 8×A40 上把 DeepSeek V4.1 Flash 解码优化到 41 tok/s — fuzhongkai · 2026-09-12
- 网友盘点 2026 年真能跑 AI 的边缘设备:Mac 到 iPhone 17 Pro — MaziyarPanahi · 2026-09-12
- 遭伊朗袭击后,阿联酋 5GW AI 园区改设计为抗打击分布式布局 — mark_k · 2026-09-12
- 单张 RTX 5090 跑 502GB 模型:DeepSeek V4.1-Flash 展示本地 AI 新架构 — AccBalanced · 2026-09-12
- 团队日跑100-200个Agent后发现:瓶颈已从算力变成磁盘空间 — vincent_koc · 2026-09-12
- Orca 发布 DeepSeek V4.1 Flash 去审查 MLX 权重,面向安全研究 — AccBalanced · 2026-09-12