AMD 用户实测:llama.cpp 官方分支 PP 提速超 2 倍

PromptInjection_ · reddit · 2026-08-23

用户推荐了 AMD 官方维护的 llama.cpp 分支。尽管有弃用警告,该分支仍在积极维护,后续会合并到主线。作者在 Strix Halo 上测试发现,使用 ROCm/Hip 后端时,密集模型的 Prompt Processing(提示词处理)速度提升超过 2 倍(14B 密集模型从 230 t/s 提升至 550 t/s)。不过,Text Generation(TG)速度比 Vulkan 慢约 15%。MoE 模型速度保持不变。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →