llama.cpp 新 PR 为 MTP 草稿启用 CUDA Graph,再榨推理速度

jacek2023 · reddit · 2026-09-17

llama.cpp 迎来 NVIDIA 工程师提交的 PR #28549:为 MTP(Multi-Token Prediction)draft 路径启用 CUDA Graph。作者称这是"又一个 MTP 加速",通过减少内核启动开销提升 draft 模型的投机解码速度。对在 llama.cpp 上跑 MTP 加速推理的用户是实用的性能改进。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →