Qwen 27B 视觉模型挤进 48GB 显存实测

Creative-Type9411 · reddit · 2026-08-17

用户分享了在 48GB 显存(3 张 Tesla T4)环境下部署 Qwen 3.8 27B MTP Q80 + Vision 模型的具体参数与配置。通过精细调整(如关闭 mmap、使用 mlock、设置 draft-mtp 等),成功在不卸载的情况下运行 19.2k 上下文,速度达 35t/s,并询问其他用户关于全上下文挤入的优化经验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →