Llama.cpp 新 PR 将采样移至 GPU,RTX 5090 推理提速 12%

otacon6531 · reddit · 2026-08-04

Llama.cpp 最近合并了一个将采样过程从 CPU 转移到 GPU 的 PR,针对开启 MTP(Multi-Token Prediction)的用户显著提升了推理速度。

实测数据显示,在 RTX 5090 上运行 Qwen3.6:35b 模型可获得约 12% 的速度提升;在较老的 Tesla P40 上也有约 4% 的增益。作者指出,由于 P40 受限于显存带宽,其提升幅度不如高端显卡,但这依然是近期本地推理栈最可观的优化之一。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →