实测结合 MTP 与 ngram-mod 进行代码生成加速
YetAnotherAnonymoose · reddit · 2026-08-18
一位开发者在 llama.cpp 中测试了将 MTP 与 ngram-mod 结合使用的推测解码效果。测试任务是让模型重复输出代码块 10 次。
测试结果:
- 初始效果显著:第一次重复时,服务端日志显示 TPS(每秒 Token 数)达到 156,而仅使用 MTP 时平均约为 60 TPS。输出表现为巨大的突发流量,随后短暂暂停。
- 性能衰减:随后的重复爆发速度越来越慢,TPS 逐渐从 169 降至 82 左右。
问题:
作者疑惑这是参数微调的问题,还是 ngram 组合在通常情况下并不值得使用。特别是针对 Qwen3.8 这种倾向于重复输出大代码块思考过程的模型,本应是 ngram 的理想用例,但性能随时间下降的现象令人费解。
「Infra」频道最新
- Epoch AI 研究员:马斯克是唯一自建数据中心的前沿实验室 CEO — soumitrashukla9 · 2026-08-18
- AI 服务器需求致 MLCC 交付期分化,高端产品近 10 个月 — zephyr_z9 · 2026-08-18
- DeepSeek V4 Flash 调优实录:n_max=3 速度提升 39% — Responsible_Pain3278 · 2026-08-18
- 英伟达拟担保高达 1050 亿美元贷款,被质疑通过融资买芯片制造虚假增长 — heypearlai · 2026-08-18
- 推理比训练更重要:LLM 全年服务但仅训练一两次 — prajdabre · 2026-08-18
- 特斯拉造机器人:复用 FSD 算法,难在物理常识 — 创业邦 · 2026-08-18