四卡 7900XTX 跑 27B 提速近一倍,作者公开 20 余项 ROCm 优化
NoFee9147 · reddit · 2026-10-07
网友用 Claude 协助为 ROCm 和 llama.cpp 服务器做了 20 余项底层优化,在 4 张 7900XTX(Lenovo P620,PCIe 4.0 x16)上运行 Qwen3.8-27B Q8,最终代码生成解码从 54-61 提升到 96-110 tok/s,51K 上下文预填充从 1454 到 1816 tok/s。主要优化点:
- 通信与调度:异步镜像输入上传(24.6→36.3 t/s);每 GPU 独立分发线程;一次性 PCIe P2P AllReduce 替代 RCCL(57μs→9μs)。
- MTP 解码:融合同形拷贝、精简 conv-state 回滚、draft 只预填最后 2048 token(解码 46.6→64.9 t/s)、draft 缓冲从 457 降到 247 MiB 修复 96K 上下文 OOM。
- 核函数优化:mmvq small-K row packing、MoE 向量核支持 8 token 批、融合 hyper-connection 链每 token 少约 380 个 kernel、Thin-F32 prefill kernel(401→21μs)。
- MoE 与注意力:紧凑 MoE tile 列表去掉 96% 空网格(down 928→405μs)、多 warp 路由排序(99→25μs)、QSA 稀疏注意力只 attend 约 2K 选中 token(48K 深度解码 67.9→80.6 t/s)。
- 其他:26.8GB 嵌入表常驻内存、MTP 图重预留修复、去 64 位除法、Split-K router GEMM 等。
作者表示若有人感兴趣会推到 GitHub 并分享配置。
「Infra」频道最新
- 前 NVIDIA 工程师爆料:一颗内存控制器报废的芯片如何靠 L2 完成测试 — blelbach · 2026-10-07
- 谁承担资金风险谁有议价权:从押金结构看 AI 算力真稀缺在哪 — tengyanAI · 2026-10-07
- vLLM v0.31.0 发布:717 个提交,vllm preload 让量化权重常驻显存免重启 — lmoroney · 2026-10-07
- AI 爬虫日刷 12 万请求压垮网站,站长怒封 ClaudeBot 一族 — burkov · 2026-10-07
- Stigg CEO:每家 AI 公司都在不小心造一家银行 — AI Engineer · 2026-10-07
- 便宜层做 1000 亿决策、Opus 只探 96 次:分层 agent 流水线实测 — Arindam_1729 · 2026-10-07