llama.cpp 支持异构设备分布式推理,GPU+笔记本跑满 40 tokens/s

joao_gante · x · 2026-10-08

ggerganov 介绍 llama.cpp 已可通过 ggml RPC 后端在异构设备间分布式推理,目前属高级玩法,后续会向普通用户开放。pcuenq 实测:在一块 RTX 6000 GPU 和一台 M5 笔记本之间通过 10 GbE 网络运行 MiMo 2.6 Flash 的原生 mxfp4 权重,达到 40 tokens/s,且为 llama.cpp 开箱即用支持。

所属事件:llama.cpp 支持异构分布式推理,RTX 6000 加笔记本跑满 40 tokens/s(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →