FreeToken 让 16GB 显卡跑 Qwen MoE 达 90+ tps,llama.cpp 社区呼吁跟进
solyarisoftware · x · 2026-09-06
- 社区在 llama.cpp 官方仓库发讨论,要求借鉴 FreeToken 的本地 MoE 推理方案:Qwen3.6-35B-A3B-NVFP4(约 23GB)在 16GB 显存的 RTX 5070 Ti 上跑到 90+ tps,后续调用超 100 tps;另一位用户在 RTX 5090 上跑 Qwen3.8-Flash-Next Q4,llama.cpp 仅 22 tps,FreeToken 达 53 tps,翻倍以上。
- FreeToken 的思路是把整台 PC 当作推理系统:专家权重放系统内存,热专家缓存进显存,cache miss 走 PCIe 流式加载,CPU 也可执行部分 miss,且 CPU 计算与 PCIe 传输可重叠——核心是动态决定「哪些专家此刻必须在显存里」。
「Infra」频道最新
- PyPI 下载量修正冲击多个包统计,数据大幅缩水 — dbreunig · 2026-09-06
- 用户实测本地跑 gemma4:31b-mlx:体验与付费订阅难以区分 — walkingriver · 2026-09-06
- 求推荐轻量 OpenAI 兼容 API 客户端:OpenWebUI 动辄 30GB 太臃肿 — MelodicRecognition7 · 2026-09-06
- SK 海力士据报考虑英特尔代工部分 HBM4e 基底裸片,以对冲台积电 3-4 倍成本 — Beth_Kindig · 2026-09-06
- B200 租约 94% 利用率下约 10 个月回本,远期曲线定价 — AccBalanced · 2026-09-06
- SlimServe 让 8 张 3090 跑 Qwen 3.8 Flash Next,解码达 1200 tok/s — QuixiAI · 2026-09-06