llama.cpp新PR优化Flash-Attention,小模型处理提速31%

pmttyji · reddit · 2026-08-13

llama.cpp社区提交了一项新的PR,针对Flash-attention中的V-cache F16到F32转换操作进行了向量化优化。

该优化利用了硬件F16C内联函数(如AVX-512、AVX2等),相比纯软件实现速度更快。实测在qwen3:4b等较小模型上,能带来17%到31%的提示词处理速率提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →