llama.cpp 新增成本加权张量拆分:混合多卡推理提速 3-4%
milpster · reddit · 2026-08-11
开发者为 llama.cpp 引入了一种基于成本加权的新张量拆分模式(-sm cost),在特定的多卡混合配置下显著提升了推理速度。
- 核心改进:默认的层级拆分将每一层视为同等计算成本,但在混合架构模型(如包含 Mamba 和 Attention 层的 Qwen3.6)中,Attention 层的计算开销远大于 Mamba 层。新模式将 Attention 层的权重设为 4.0,Mamba 层设为 1.0,从而更合理地分配负载。
- 性能收益:在混合不同速度的多 GPU 环境下(如 AMD + NVIDIA 混插),该方案能将最慢显卡的负载减少 1-2 层,结合流水线并行(Pipeline Parallelism)技术,实现了约 3-4% 的稳定解码速度(TG)提升。
- 拓扑结构建议:作者强调了跨厂商显卡传输需经过系统内存的瓶颈,建议采用“快-慢-快”的设备排列顺序,将慢速显卡置于流水线中间,以通过计算重叠掩盖跨厂商传输延迟。
- 适用场景:该优化仅对包含 Mamba/SSM + Attention 的混合模型、混合速度的多 GPU 环境且开启流水线并行时有效。
「Infra」频道最新
- 中国首款国产前道光刻机投产,性能对标 90 年代 ASML — pstAsiatech · 2026-08-11
- 不足10%企业规模化落地AI,算力短缺将长期制约 — BenBajarin · 2026-08-11
- 亚马逊AI算力扩张引争议:或成美国最大气候污染源 — Ars Technica AI · 2026-08-11
- 港大团队突破冯·诺依曼瓶颈,研发极低能耗二维材料 AI 芯片 — YiMaTweets · 2026-08-11
- Blockstream推出原子交换服务,应对AI辅助攻击潮 — RSync25 · 2026-08-11
- RTX 3060 Ti 也能本地跑视频生成:20 分钟出片,8GB 显存够用 — cocktailpeanut · 2026-08-11