8GB 显存跑 35B MoE 模型,投机解码到底该不该开

Infinite-Local5435 · reddit · 2026-09-14

Reddit 用户 Infinite-Local5435 询问在显存卸载(offloading)场景下是否应开启投机解码:配置为 35B A3B 的 MoE 模型、8GB 显存的 RTX 5060 加 32GB 内存,当前 llama-server 配置下约 40 tok/s 生成、500 tok/s 预填充,开启 FA、q8 KV cache、q4KXL 量化,batch 与 ubatch 均为 4096。

作者提到约两三个月前的社区共识是用 NTP(自然温度预测相关方案)提升速度,但传闻会大幅拖慢 prompt 处理,想知道现在是否仍然如此,以及大家如何在 llama-server 中配置投机解码/MTP。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →