llama.cpp新PR优化Flash-Attention,小模型处理提速31%
pmttyji · reddit · 2026-08-13
llama.cpp社区提交了一项新的PR,针对Flash-attention中的V-cache F16到F32转换操作进行了向量化优化。
该优化利用了硬件F16C内联函数(如AVX-512、AVX2等),相比纯软件实现速度更快。实测在qwen3:4b等较小模型上,能带来17%到31%的提示词处理速率提升。
「Infra」频道最新
- 288张GPU与23.5TB显存:这还能叫本地部署吗? — MaziyarPanahi · 2026-08-13
- 实测揭示 MCP 协议隐性成本:相同任务算力消耗最高达 3 倍 — KitchenAmoeba4438 · 2026-08-13
- Mixtral-8x7B-AWQ部署踩坑:vLLM推理无限循环生成解析 — Patentsmatter · 2026-08-13
- 浏览器本地跑30B模型:速度超30 tok/s — MaziyarPanahi · 2026-08-13
- 英伟达高管:银行 AI 优势源于自有数据与基础设施 — marc_stampfli · 2026-08-13
- Hugging Face 新研究:LLM Agent 调度机制优化 GPU 资源 — Josef Liyanjun Chen · 2026-08-13