llama.cpp AMD GFX906 优化分支:PP 提升 14%,长上下文填充提升 9%
milpster · reddit · 2026-09-01
作者发布了针对 AMD Radeon VII / MI50 / MI60 (GFX906) 架构优化的 llama.cpp 分支。经测试,相比上游版本,该分支在首批次 Prompt Processing (PP) 上提升 14.1%(379.2 vs 332.3 t/s),在 12 万上下文填充上提升 9.3%(252.6 vs 231.1 t/s),深上下文 TG 性能持平。优化主要涉及重做小批量 Flash Attention 路径及添加自适应原生/转换选择。
「Infra」频道最新
- 腾讯 Hy4 预览版:1.25bit 量化将体积缩减 7 倍 — ccerrato147 · 2026-09-01
- Brave 浏览器开源 Rust 广告拦截引擎 adblock-rust — gnukeith · 2026-09-01
- 评论:人形机器人销量预测被指是“被遗忘的噱头” — TiernanRayTech · 2026-09-01
- Hugging Face 新增激活检查点卸载,大模型显存占用骤降 — StasBekman · 2026-09-01
- Meta 开源 MetaRoCE 协议,优化以太网 AI 集群 — Meta_Engineers · 2026-09-01
- 内存成本飙升,亚马逊连夜涨 Echo/Kindle 价 — film_girl · 2026-09-01