llama.cpp 跑 Qwen3.6-35B MTP 投机解码,求 draft 接受率调优
Bulky-Priority6824 · reddit · 2026-09-07
一位用户在 Reddit 求助:用 llama.cpp 的 llama-server 本地部署 Qwen3.6-35B-A3B(MTP 版 Q8KXL 量化),开启 draft-MTP 投机解码(spec-draft-n-max 5),询问 draft 接受率是否已达到正常范围、还有什么可调的空间。
帖中给出完整启动命令,关键配置包括:
- 100K 上下文、f16 KV cache、flash-attn、kv-unified
- 三卡 tensor-split 34,40,26、cont-batching、parallel 2
- 采样参数 temp 0.6 / top-p 0.80 / top-k 20 / min-p 0.05
对想本地跑 MTP 投机解码的开发者是难得的完整参考配置。
「Infra」频道最新
- 高盛看多韩股近 80% 上行空间,AI 存储热潮驱动 Kospi 目标 12000 — Polymarket · 2026-09-07
- 10万 GPU 而非 NVL72 整机架:超大集群规模传闻被纠偏 — firstadopter · 2026-09-07
- Astra 算力效率几何?业界推算前沿模型训练成本差距可达十倍 — teortaxesTex · 2026-09-07
- 白嫖 20 小时:Kaggle 免费跑 Qwen3 27B 供 Agent 调用 — TheMoonMidas · 2026-09-07
- Google 发布 MaxKernel:多智能体系统自动写 TPU kernel 达专家级 — google · 2026-09-07
- 量化毁掉 RNN 记忆?误差反馈可免训练恢复 GRU/LSTM 精度 — Ismail Erbas · 2026-09-07