llama.cpp 新 PR 优化 GDN 状态,再提速 Qwen 3.x 预填充

jacek2023 · reddit · 2026-10-08

开发者 SongXiaoXi 向 llama.cpp 提交 PR #30087,通过让每个 warp 分配四个 GDN(gated delta net)状态列,优化 prompt processing 阶段的性能,是针对 Qwen 3.x 系列的又一轮推理加速。作者称很快你的 Qwen 就能在眨眼间读完全部项目代码。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →