llama.cpp新PR:Intel显卡长文本解码速度提升超169%
BTA_Labs · reddit · 2026-08-08
llama.cpp 最近的一个 PR(#26689)通过修改一个极小的 SYCL FlashAttention 分发逻辑,为 Intel Battlemage 显卡在超长上下文推理时带来了巨大的性能提升。
- 核心改动:在量化 KV cache(如 q40 / q80)下,将解码过程从原本强制使用的 VEC kernel 切换为 TILE kernel。
- 实测数据:在 118K 上下文长度下,Qwen3.6-35B 和 Gemma 4 12B 模型的解码速度分别提升了 127.9% 至 168.7%不等。在 32K 上下文时,也有约 42% 到 74% 的显著提升。
- 注意事项:目前该 PR 尚未合并,数据主要来自作者本人的测试,且主要针对量化 KV cache(F16 保持原有逻辑)。社区呼吁有 B580/B70 等硬件的用户进行独立复现验证。
「Infra」频道最新
- JSON 正在拖垮你的 CPU:工程视角下的解析成本剖析 — techNmak · 2026-08-08
- parakeet.wgsl:纯 WebGPU 实现 20 秒转录 1 小时音频 — hamza_q_ · 2026-08-08
- Gary Marcus:神经符号 AI 崛起,CPU 需求将触底反弹 — Gary Marcus · 2026-08-08
- Fluidstack 招募启示:以造船厂模式构建吉瓦级 AI 超算中心 — MxMnr · 2026-08-08
- 自我改进 Agent 优化推理栈,B200 上实现 18% 加速 — yisongyue · 2026-08-08
- KerasHub原生集成vLLM,内置投机解码大幅提升性能 — fchollet · 2026-08-08