llama.cpp AMD GFX906 优化分支:PP 提升 14%,长上下文填充提升 9%

milpster · reddit · 2026-09-01

作者发布了针对 AMD Radeon VII / MI50 / MI60 (GFX906) 架构优化的 llama.cpp 分支。经测试,相比上游版本,该分支在首批次 Prompt Processing (PP) 上提升 14.1%(379.2 vs 332.3 t/s),在 12 万上下文填充上提升 9.3%(252.6 vs 231.1 t/s),深上下文 TG 性能持平。优化主要涉及重做小批量 Flash Attention 路径及添加自适应原生/转换选择。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →