Reddit 网友为 7900XTX 定制 llama.cpp:27B Q8 跑出 1600tk/s 预填充
nasone32 · reddit · 2026-09-08
一位 Reddit 用户发布了针对 AMD 7900XTX(单卡/双卡)深度优化的 llama.cpp 定制构建,目标是让 Qwen 系列模型在消费级 ROCm 平台上跑出可用速度。
核心成绩:
- Qwen 3.8 Next Q3KXL:双卡 pp8192 达 920tk/s,正文生成 24-27tk/s,代码 40+tk/s
- Qwen 3.8 27B Q80:pp8192 达 1600tk/s,正文 60-65tk/s,代码 100+tk/s(其中一卡还在芯片组后的 PCIe x4 上)
- Qwen 3.6 27B Q4KM 单卡:pp8192 约 1020tk/s,正文 58-60tk/s
关键技术点:
- 自定义 HIP allreduce 路径,让位于芯片组后的卡也能开 tensor parallel
- 卡间 PCIe 传输数据压缩到 Q80 节省带宽
- 集成 RDNABOOST 修复与 --adaptive-mtp(按接受率自动调 MTP n-max)
- 支持尚未上游合并的 PR:如 lazy PLE 路径带来 +58.88% Flash 提升、GPU MoE expert cache 解码 +19.95%、DFLASH2 tensor parallel 支持等
作者在 Ubuntu 24 + ROCm 7.14 测试,不提供支持,希望这些补丁最终被上游合并。项目地址:github.com/nasone32/llama.cpp-RDNA3-7900xtx-opt
「Infra」频道最新
- CPU 本地跑模型实测:35B MoE 量化版胜过 2B 小模型 — ML-Future · 2026-09-08
- 13 星开源项目 HydraDB:整个图数据库直接活在 S3 里 — thisdudelikesAI · 2026-09-08
- 单卡 4090 跑 Qwen 27B/Gemma 31B 本地推理,如何平衡量化与上下文 — MooseEfficient2151 · 2026-09-08
- 凌晨想法:能否用分布式 iPhone 组成推理网络? — gajesh · 2026-09-08
- 候选深度 10→500 分数仅涨 0.01:Qdrant 实测检索调参先诊断再动手 — qdrant_engine · 2026-09-08
- 离散扩散并行采样加速 LLM 推理,无需草稿模型且无损 — IFM · 2026-09-08