RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec

pcuenq · x · 2026-10-07

Hugging Face 工程师 pcuenq 演示在异构硬件上跑本地大模型:用 RTX 6000 Blackwell 与 M5 笔记本跨机分布式推理 MiMo 2.6 Flash,通过 10 GbE 连接,达到 40 tokens/sec,加载的是原生 mxfp4 权重,llama.cpp 开箱即用。他认为本地模型已逼近前沿水平,越来越多的场景不需要最大的闭源模型。

所属事件:HF 工程师 RTX 6000 加 M5 笔记本异构跑大模型达 40 t/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →