RTX 6000 Pro 运行 Qwen 3.8 27B 最佳配置探讨

vhthc · reddit · 2026-08-25

作者分享了在单张 RTX 6000 Pro 上运行 Qwen 3.8 27B BF16 版本的 llama-server 配置,支持 256kb 上下文。关键设置包括启用 draft-mtp 推测解码(约 2 倍提速)、关闭 mmap 以规避 ZFS/OOM 问题。当前生成速度为 50-60 t/s,长提示词处理达 3000 t/s。作者正考虑迁移至 vllm 或 sglang 以获得更好的模型切换性能,并寻求优化建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →