llama.cpp 支持异构设备分布式推理,GPU+笔记本跑满 40 tokens/s
joao_gante · x · 2026-10-08
ggerganov 介绍 llama.cpp 已可通过 ggml RPC 后端在异构设备间分布式推理,目前属高级玩法,后续会向普通用户开放。pcuenq 实测:在一块 RTX 6000 GPU 和一台 M5 笔记本之间通过 10 GbE 网络运行 MiMo 2.6 Flash 的原生 mxfp4 权重,达到 40 tokens/s,且为 llama.cpp 开箱即用支持。
所属事件:llama.cpp 支持异构分布式推理,RTX 6000 加笔记本跑满 40 tokens/s(4 条相关)→
「Infra」频道最新
- IBM 将 Spyre AI 加速器接入 PyTorch,借原生设备抽象实现一套框架多硬件 — PyTorch · 2026-10-08
- audio.cpp 大更新:Higgs Audio TTS 显存省 48%,支持 110+ 音频模型 — Acceptable-Cycle4645 · 2026-10-08
- 南亚 7 月营收环比涨 49.3%:合约到期重签成涨价主因 — tengyanAI · 2026-10-08
- 三星涨价最猛却签 5 年长约:关键在重定价机制而非锁价 — tengyanAI · 2026-10-08
- SK hynix 称霸 HBM 却录得四大厂最小 DRAM 涨幅,真相在口径 — tengyanAI · 2026-10-08
- 攻击者跨多家推理服务商作案,Hugging Face 职工呼吁联合封禁机制 — natolambert · 2026-10-08