16GB 显卡跑 Qwen 27B 还带视觉:85K 上下文、45 t/s 配置公开
FerLuisxd · reddit · 2026-09-10
作者分享了在 5060 Ti(16GB)上完整运行 Qwen 3.8 27B 视觉模型的量化配置,解码速度约 45 t/s、prefill 约 300 t/s,并留有约 1.5GB 余量可继续扩上下文。
关键配置要点:
- 模型:ISTA-DASLab 的 IQ3XXS-mtp GGUF 量化,搭配 BF16 mmproj 实现视觉
- 使用 beellama.cpp 推理,上下文开到 85K,gpu-layers 全放 GPU、direct-io 打开
- KV cache 用 kvarn4 压缩(k/v 均开),作者附基准链接说明其质量损失可接受
- 开启 draft-mtp 投机解码(spec-draft-n-max=2)提升解码速度
- 可选优化:把 mmproj 挪到 CPU 再挤显存
完整配置已贴出,作者征集其他 16GB 显存的甜点配置。
「Infra」频道最新
- ONcompute 上线:按小时租专用 GPU 跑任意模型,明码标价 — w1kke · 2026-09-10
- MiniMax H3 生态日报:新量化、像素画指南与 LoRA 训练器齐更新 — optimisticalish · 2026-09-10
- Nvidia 携手 Palantir 用 AI 管理供应链,先管自家百万零件 — The Decoder · 2026-09-10
- AMD 7900 XT 跑 MiniMax H3 视频生成提速指南:约 4 分钟出 5 秒视频 — Big_Extension_9987 · 2026-09-10
- CUDA 13.4 支持 Windows on Arm,为 10 月 RTX Spark AI 笔记本铺路 — kimmonismus · 2026-09-10
- 纯 C 引擎 colibri 走红:从磁盘流式加载专家,本地跑前沿 MoE — JustVugg · 2026-09-10