8GB 显存跑 35B MoE 模型,投机解码到底该不该开
Infinite-Local5435 · reddit · 2026-09-14
Reddit 用户 Infinite-Local5435 询问在显存卸载(offloading)场景下是否应开启投机解码:配置为 35B A3B 的 MoE 模型、8GB 显存的 RTX 5060 加 32GB 内存,当前 llama-server 配置下约 40 tok/s 生成、500 tok/s 预填充,开启 FA、q8 KV cache、q4KXL 量化,batch 与 ubatch 均为 4096。
作者提到约两三个月前的社区共识是用 NTP(自然温度预测相关方案)提升速度,但传闻会大幅拖慢 prompt 处理,想知道现在是否仍然如此,以及大家如何在 llama-server 中配置投机解码/MTP。
「Infra」频道最新
- 自费实测 15 个 GPU 任务:成本估算平均偏高 33% — Worldly_North_7213 · 2026-09-14
- Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行 — amos_gyamfi · 2026-09-14
- 512MB 内存小板子跑 Agent:内存与执行分离实现跨机自迁移 — D777Castle · 2026-09-14
- 3000 会话 300 亿 token 实测:模型真正输出只占 0.3%,97% 输入来自缓存 — Rare_Guide_9830 · 2026-09-14
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14