llama.cpp 自适应 MTP PR:代码生成提速最高翻倍
Look_0ver_There · reddit · 2026-08-18
作者为 llama.cpp 提交了 PR #27210,加入自适应 MTP(Multi-Token Prediction)模式:用一个简单的计数式状态机动态决定投机解码的 draft 深度,用户不必再纠结 MTP 深度设多少。
实测表现:
- 普通散文与高难度文本约比固定 MTP=3 慢 3% 左右(部分散文场景略快)。
- 代码生成快 10-15%;从思考阶段回忆代码时提速超 50%;模型凭记忆重写整个文件时最高快 100%。
- 回忆性文本提速约 20-30%。
- 温度越高、输出越不可预测,优势越小,但代码场景仍略优。
推荐配置:--spec-type draft-mtp-adaptive --spec-draft-n-max 12(深度 3-12 自动调节),可用 --spec-draft-n-min-adaptive 调低深度下限。
「Infra」频道最新
- OpenAI 降价 80% 后账单反涨:推理版 Jevons 悖论 — AccBalanced · 2026-08-18
- 为何 Stripe 花十亿买 Metronome — mattturck · 2026-08-18
- 投资人图表:token 消耗三波浪潮,2030 年预计增长 24 倍 — AccBalanced · 2026-08-18
- 分析师用精密模型把制造产能映射到 27/28 年厂商营收 — BenBajarin · 2026-08-18
- 单张 5090 如何跑 Qwen3.8-27B:量化与上下文的取舍讨论 — DustNearby2848 · 2026-08-18
- 开源工具 SlimToken:请求进模型前先压缩上下文,实测省 57-64% token — Intelligent-Key7357 · 2026-08-18