llama.cpp 新 PR:为 Qwen 启用稀疏 FlashAttention 再提速
jacek2023 · reddit · 2026-09-21
ggml-org/llama.cpp 仓库合并了一个 CUDA 优化 PR(#28770),由 am17an 提交,为 Qwen(Flash Next)系列启用稀疏 FlashAttention,进一步提升推理速度。作者称这是「又一个 Qwen Flash Next 提速优化」,属于 llama.cpp 社区对本地推理性能的持续打磨。
「Infra」频道最新
- 开源向量索引 Turbovec:1000万文档从31GB压到4GB,搜索快过 FAISS — bibryam · 2026-09-21
- Google Agent Substrate 曝光:AX 应用层叠加在托管智能体算力之上 — rakyll · 2026-09-21
- RL rollout 需求爆发,沙盒即服务创业赛道能否长期成立? — dejavucoder · 2026-09-21
- 大胆预测:Agent 将发现百万倍廉价训练法,数据中心或成尴尬摆设 — menhguin · 2026-09-21
- 开源模型 Jev 经 CoreML 在 Mac M4 离线跑出每秒 45 次决策 — putna · 2026-09-20
- 分析师:Agentic 场景 CPU 与 GPU 配比不会到 40:1,实际约 4:1 — BenBajarin · 2026-09-20