12GB 显存跑 35B MoE:4070Ti 上 60 tok/s 实测配置全公开
Seraphym87 · reddit · 2026-08-20
作者在 RTX 4070 Ti(12GB)+ i9-13900KF + 32GB DDR5 上用 llama.cpp 跑 Ornith-1.5-35B-A3B(Qwen3.5 MoE 架构,总参 36B、激活约 3B,Q4KM 量化约 20GB)的完整实测。
核心思路是尽量多地把激活专家放进显存、其余 offload 到内存:--n-cpu-moe 28 时显存还剩约 1GB 给 KV cache。实测约 50–56 tok/s 持续生成、650–700 tok/s prefill;配合 MTP 投机解码,draft 接受率约 42–48%。llama-bench 对比显示 n-cpu-moe 26/27/28 时生成速度 64.9/64.3/62.6 t/s,prefill 随 offload 增多下降。作者给出完整启动命令(-ngl 99、q80 KV cache、flash attention、MTP draft 等),证明消费级显卡也能流畅跑 35B MoE 推理模型。
「Infra」频道最新
- 本地 LLM 量化避坑指南:FP8/NVFP4 等格式的硬件门槛 — Ill_Dragonfruit_3547 · 2026-08-20
- Mojo集成MLIR栈运行矩阵乘法,ModCon大会演示异构计算 — clattner_llvm · 2026-08-20
- 硬件迭代工具 Blueprint 获 a16z 领投超百万美元 — Scobleizer · 2026-08-20
- Mac 本地运行 27B 多模态模型,三年前不可想象 — TheMoonMidas · 2026-08-20
- RTX PRO 6000 Blackwell 评测:多 GPU 塔式工作站首选 — TheZachMueller · 2026-08-20
- Dory:Mac 上的本地 Docker 与 Linux 桌面替代方案 — tom_doerr · 2026-08-20