llama.cpp 合并概率 MTP 解码,散文生成提速 14%
Dreeew84 · reddit · 2026-10-11
llama.cpp 已合并 probabilistic MTP(multi-token prediction)解码优化(PR #27694),作者实测 prose 生成速度提升约 14%。建议用户更新 llama.cpp 并尝试。
- 最佳参数 draft-n-max / draft-p-min 与 greedy sampling 一致
- 主要收益集中在散文(prose)生成场景
- 测试时关闭了 thinking 与 ngram-mod
「Infra」频道最新
- 5080 + 3080Ti 混合双卡:如何给大模型腾出显存 — MonkeyCartridge · 2026-10-11
- 实测体验:笔记本跑本地 AI,Mac 比 Linux 更扛 24/7 常驻推理 — TheZachMueller · 2026-10-11
- 本地跑 LLM 扩容思路:~$600 即可入手 6 卡 Gen4 GPU 背板 — TheZachMueller · 2026-10-11
- 每月约 20 欧租 GeForce NOW,实测 Gemma 4 31B 跑出 41 TPS — evilsocket · 2026-10-11
- token 降价刺激需求,a16z 数据揭示 AI 版杰文斯悖论 — The Decoder · 2026-10-11
- 要 4 个 Gen5 槽位跑 AI?WRX90 主板原生就有 7 个 — TheZachMueller · 2026-10-11