llama.cpp 更新提升 Intel 推理性能
pmttyji · reddit · 2026-07-15
llama.cpp 最近合并了一批面向 SYCL / Intel 的更新,重点是性能和算子支持:
- 通过 oneDNN graph API 的 Flash Attention / SDPA 优化,在 Xe2 上带来明显提速;文中给出的例子是 Qwen3.6-27B-Q80,在 p=512 时预填充速度提升 1.21x,在 p=80k 时提升 4.26x。
- 另外还包括:调整 USM system allocation 的最小 buffer size、支持 OP XIELU、支持 fp16 的 conv2ddw kernel、修复 getrows 在多个量化格式下的精度问题。
整体看,这是一次很典型的本地推理栈优化:既提升 Intel 平台可用性,也直接改善长上下文预填充性能。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11