RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec
pcuenq · x · 2026-10-07
Hugging Face 工程师 pcuenq 演示在异构硬件上跑本地大模型:用 RTX 6000 Blackwell 与 M5 笔记本跨机分布式推理 MiMo 2.6 Flash,通过 10 GbE 连接,达到 40 tokens/sec,加载的是原生 mxfp4 权重,llama.cpp 开箱即用。他认为本地模型已逼近前沿水平,越来越多的场景不需要最大的闭源模型。
所属事件:HF 工程师 RTX 6000 加 M5 笔记本异构跑大模型达 40 t/s(2 条相关)→
「Infra」频道最新
- 充电公司 Xeal 计划在美部署 10 万块英伟达 GPU,建边缘推理网络 — Nandu_alias_Parthu · 2026-10-07
- Tokio作者打造的Rust ORM Toasty全面支持Turso数据库 — glcst · 2026-10-07
- Ollama v0.40.0上线:Apple Silicon自动启用MLX运行时 — lmoroney · 2026-10-07
- 48GB Mac 跑 Qwen-Image-2.1:分阶段加载把峰值显存从 43.6GB 降到 19GB — nefayran · 2026-10-07
- 瑞典住房与数据中心争地:AI 时代基建挤占居住空间 — nordicinst · 2026-10-07
- 英伟达估 NVLink Fusion 市场规模至 2030 年前接近 2500 亿美元 — Beth_Kindig · 2026-10-07