llama.cpp 新 PR:为 Qwen 启用稀疏 FlashAttention 再提速

jacek2023 · reddit · 2026-09-21

ggml-org/llama.cpp 仓库合并了一个 CUDA 优化 PR(#28770),由 am17an 提交,为 Qwen(Flash Next)系列启用稀疏 FlashAttention,进一步提升推理速度。作者称这是「又一个 Qwen Flash Next 提速优化」,属于 llama.cpp 社区对本地推理性能的持续打磨。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →