llama.cpp 合并为 Gemma 26B A4B 优化 flash attention 形状
jacek2023 · reddit · 2026-09-23
ggml-org/llama.cpp 仓库的 PR #28450 针对本地推理优化了 gemma4-26b-a4b 的 flash attention 张量形状,带来可感知的速度提升。
这类底层形状调优是 llama.cpp 社区榨取端侧推理性能的常规手段,对在本地跑 Gemma 系列模型的用户有直接收益,PR 已被提交待合并。
「Infra」频道最新
- 去中心化推理平台 Chutes 换帅,公开展示 8B MoE 预训练全程 — markjeffrey · 2026-09-23
- 后训练框架 Halo 宣称吞吐达 TRL 2.8 倍,遭质疑选择性跑分 — _ScottCondron · 2026-09-23
- OpenAI 解释 GPT-6 降价:缓存与推理优化省下的钱直接让利 — OpenAIDevs · 2026-09-23
- OpenAI 工程师详解 GPT-Live 实时语音系统如何构建 — juberti · 2026-09-23
- 2030 年中美数据中心耗电量预测:中国 774 TWh、美国 649 TWh — teortaxesTex · 2026-09-23
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23