RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec
pcuenq · x · 2026-10-07
同帖原推:作者用 RTX 6000 与 M5 笔记本经 10 GbE 跨机分布式推理 MiMo 2.6 Flash,原生 mxfp4 权重,llama.cpp 原生支持,达 40 tokens/sec,感叹本地 AI 已逼近前沿水平。
所属事件:HF 工程师 RTX 6000 加 M5 笔记本异构跑大模型达 40 t/s(2 条相关)→
「Infra」频道最新
- 充电公司 Xeal 计划在美部署 10 万块英伟达 GPU,建边缘推理网络 — Nandu_alias_Parthu · 2026-10-07
- Tokio作者打造的Rust ORM Toasty全面支持Turso数据库 — glcst · 2026-10-07
- Ollama v0.40.0上线:Apple Silicon自动启用MLX运行时 — lmoroney · 2026-10-07
- 48GB Mac 跑 Qwen-Image-2.1:分阶段加载把峰值显存从 43.6GB 降到 19GB — nefayran · 2026-10-07
- 瑞典住房与数据中心争地:AI 时代基建挤占居住空间 — nordicinst · 2026-10-07
- 英伟达估 NVLink Fusion 市场规模至 2030 年前接近 2500 亿美元 — Beth_Kindig · 2026-10-07