llama.cpp 新 PR 为 MTP 草稿启用 CUDA Graph,再榨推理速度
jacek2023 · reddit · 2026-09-17
llama.cpp 迎来 NVIDIA 工程师提交的 PR #28549:为 MTP(Multi-Token Prediction)draft 路径启用 CUDA Graph。作者称这是"又一个 MTP 加速",通过减少内核启动开销提升 draft 模型的投机解码速度。对在 llama.cpp 上跑 MTP 加速推理的用户是实用的性能改进。
「Infra」频道最新
- 贝尔实验室如何错失微芯片:IEEE Spectrum 复盘一段技术史教训 — ArtificialOther · 2026-09-17
- RCR 研报:AI Agent 将成网络基础设施的下一类"用户" — seankinneyRCR · 2026-09-17
- B200现货租金八个月涨80%,算力需求跑赢供给扩张 — JOBhakdi · 2026-09-17
- MLX-Serve 新版发布:M4/M5 Max 上 Qwen Flash 跑出 100+ tok/s — TheMoonMidas · 2026-09-17
- 16GB 内存硬跑 14B 模型,网友自嘲把电脑跑成了面包机 — Aggravating_Site381 · 2026-09-17
- fal 工程负责人:绝不预训练模型,推理算力才是真护城河 — jfischoff · 2026-09-17