HF 工程师异构硬件跑本地大模型达 40 tokens/s
Hugging Face 工程师 pcuenq 演示在异构硬件上进行跨机分布式推理:用 RTX 6000 Blackwell 与 M5 笔记本经 10 GbE 连接运行 MiMo 2.6 Flash,使用原生 mxfp4 权重并由 llama.cpp 原生支持,达到 40 tokens/sec。作者还晒出自制微型集群,包含 M1 Max(64GB)、M5 Max(128GB) 与装 RTX 6000 的 Linux 主机。
2026-10-07 ~ 2026-10-07 · 3 条相关
- RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec — pcuenq · 2026-10-07
- RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec — pcuenq · 2026-10-07
- 晒出自制微型集群:M5 Max 128GB+Linux RTX 6000 跑本地 AI — pcuenq · 2026-10-07