HF 工程师异构硬件跑本地大模型达 40 tokens/s

Hugging Face 工程师 pcuenq 演示在异构硬件上进行跨机分布式推理:用 RTX 6000 Blackwell 与 M5 笔记本经 10 GbE 连接运行 MiMo 2.6 Flash,使用原生 mxfp4 权重并由 llama.cpp 原生支持,达到 40 tokens/sec。作者还晒出自制微型集群,包含 M1 Max(64GB)、M5 Max(128GB) 与装 RTX 6000 的 Linux 主机。

2026-10-07 ~ 2026-10-07 · 3 条相关