llama.cpp 新 PR 优化 GDN 状态,再提速 Qwen 3.x 预填充
jacek2023 · reddit · 2026-10-08
开发者 SongXiaoXi 向 llama.cpp 提交 PR #30087,通过让每个 warp 分配四个 GDN(gated delta net)状态列,优化 prompt processing 阶段的性能,是针对 Qwen 3.x 系列的又一轮推理加速。作者称很快你的 Qwen 就能在眨眼间读完全部项目代码。
「Infra」频道最新
- 800+ 常驻智能体的 LLM 小镇:并发决策、上下文缓存与推理成本实录 — Low_Bad_6585 · 2026-10-08
- AI 借贷成本冲上 11%,两年举债 6250 亿美元,2030 年建设或花 5 万亿 — mjdramstead · 2026-10-08
- 两台 DGX Spark 跑 GLM 5.3 Flash:完整本地部署配方开源 — EAccelerate_42 · 2026-10-08
- tinygrad 推出新 tinybox 深度学习整机,可自选配置定制 — GiorgioPatrini · 2026-10-08
- 推理规模已超训练,NVIDIA 拟建 25 座 5-20MW 小型数据中心 — FinanceYF5 · 2026-10-08
- MIT 科技评论:工业自主 AI 时代需要新的数据与治理框架 — nordicinst · 2026-10-08