Llama.cpp 新 PR 将采样移至 GPU,RTX 5090 推理提速 12%
otacon6531 · reddit · 2026-08-04
Llama.cpp 最近合并了一个将采样过程从 CPU 转移到 GPU 的 PR,针对开启 MTP(Multi-Token Prediction)的用户显著提升了推理速度。
实测数据显示,在 RTX 5090 上运行 Qwen3.6:35b 模型可获得约 12% 的速度提升;在较老的 Tesla P40 上也有约 4% 的增益。作者指出,由于 P40 受限于显存带宽,其提升幅度不如高端显卡,但这依然是近期本地推理栈最可观的优化之一。
「Infra」频道最新
- Runware推出模块化数据中心Sonic Inference Pod,称成本更低部署更快 — RebeccaBellan · 2026-08-04
- Zilla 2.0 将 MCP 原生集成:无需额外封装直接对接 REST 与 Kafka — jkriket · 2026-08-04
- 算力基建的争议:一篇长文为AI数据中心的经济账辩护 — david_stillwell · 2026-08-04
- MacBook 两行命令跑本地大模型:零成本实现无限调用 — tomcrawshaw01 · 2026-08-04
- 开发者探讨为 AMD MI100 打造即插即用 AIO 散热方案 — psychoOC · 2026-08-04
- AI芯片创企 DeepX 获新一轮融资,估值翻四倍 — pstAsiatech · 2026-08-04