AMD 用户实测:llama.cpp 官方分支 PP 提速超 2 倍
PromptInjection_ · reddit · 2026-08-23
用户推荐了 AMD 官方维护的 llama.cpp 分支。尽管有弃用警告,该分支仍在积极维护,后续会合并到主线。作者在 Strix Halo 上测试发现,使用 ROCm/Hip 后端时,密集模型的 Prompt Processing(提示词处理)速度提升超过 2 倍(14B 密集模型从 230 t/s 提升至 550 t/s)。不过,Text Generation(TG)速度比 Vulkan 慢约 15%。MoE 模型速度保持不变。
「Infra」频道最新
- 新书《Just Use Postgres!》涵盖 AI 与 RAG 实践 — bibryam · 2026-08-23
- 纽约州全美首个数据中心禁令,引发反对声浪 — Dan_Jeffries1 · 2026-08-23
- Unswarm:自托管 LLM 运行时管理器,支持多模型队列与代理 — Atretador · 2026-08-23
- Mistral 被曝 2030 年前在欧洲布局至多 1GW 算力 — emmanuelvivier · 2026-08-23
- AI 与 RAG 必读:新闻搜索 API 深度横向对比 — ermanos12 · 2026-08-23
- Unsloth 版 Qwen3.8-27B 移植 MTP 模式,显存占用更低 — Nyghtbynger · 2026-08-23