12GB 显存跑 35B MoE:4070Ti 上 60 tok/s 实测配置全公开

Seraphym87 · reddit · 2026-08-20

作者在 RTX 4070 Ti(12GB)+ i9-13900KF + 32GB DDR5 上用 llama.cpp 跑 Ornith-1.5-35B-A3B(Qwen3.5 MoE 架构,总参 36B、激活约 3B,Q4KM 量化约 20GB)的完整实测。

核心思路是尽量多地把激活专家放进显存、其余 offload 到内存:--n-cpu-moe 28 时显存还剩约 1GB 给 KV cache。实测约 50–56 tok/s 持续生成、650–700 tok/s prefill;配合 MTP 投机解码,draft 接受率约 42–48%。llama-bench 对比显示 n-cpu-moe 26/27/28 时生成速度 64.9/64.3/62.6 t/s,prefill 随 offload 增多下降。作者给出完整启动命令(-ngl 99、q80 KV cache、flash attention、MTP draft 等),证明消费级显卡也能流畅跑 35B MoE 推理模型。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →