单卡96GB实测Qwen3.8 跑通17万上下文

有用户在配备 96GB 显存的 RTX 6000 Pro 单卡上部署 Qwen3.8-Flash-Next(GGUF 量化版本),通过 llama.cpp 完成配置与优化后,实测实现约 17 万 token 的上下文长度,生成速度达每秒 109 至 110 token,并分享了详细的部署配置与量化方案等实战经验。

2026-08-30 ~ 2026-09-01 · 2 条相关