单卡96GB实测Qwen3.8 跑通17万上下文
有用户在配备 96GB 显存的 RTX 6000 Pro 单卡上部署 Qwen3.8-Flash-Next(GGUF 量化版本),通过 llama.cpp 完成配置与优化后,实测实现约 17 万 token 的上下文长度,生成速度达每秒 109 至 110 token,并分享了详细的部署配置与量化方案等实战经验。
2026-08-30 ~ 2026-09-01 · 2 条相关
- 单卡 96GB 跑通 Qwen3.8 17 万上下文实测 — UltrMgns · 2026-08-30
- RTX 6000 Pro 跑 Qwen3.8 性能实测:96GB 显存达 109 tok/s — FantasticNature7590 · 2026-09-01