RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec

pcuenq · x · 2026-10-07

同帖原推:作者用 RTX 6000 与 M5 笔记本经 10 GbE 跨机分布式推理 MiMo 2.6 Flash,原生 mxfp4 权重,llama.cpp 原生支持,达 40 tokens/sec,感叹本地 AI 已逼近前沿水平。

所属事件:HF 工程师 RTX 6000 加 M5 笔记本异构跑大模型达 40 t/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →