M5 Ultra 256GB 首测 Mimo2.6-Flash:32K 上下文 49 tok/s
bakawolf123 · reddit · 2026-09-22
Reddit 用户收到 M5 Ultra(36 核/80 核 GPU,256GB 统一内存)后,自己写了 mlx-vlm 补丁抢先跑 Mimo2.6-Flash 原始权重,并给出早期性能数据。
- 32K prompt / 64 tokens 生成:prompt 处理约 1238 tok/s,生成平均 49.1 tok/s
- 64K prompt / 1024 tokens:prompt 约 982 tok/s,生成降至 38.1 tok/s,总耗时约 90 秒
- 模型开启了 MTP 但疑似未生效;评价是「能用但平平」(pretty meh, but usable)
- 附了 oMLX 跑 qwen3.8-flash-next fp8 的对比:输出侧 42-44 tok/s,内存占用 177-188GB
- 目前还没有开箱即用的支持,作者靠手写补丁加载原始权重
「Infra」频道最新
- GPU 同样的算力四种卖法:Nebius 现货定价背后的基建经济学 — demian_ai · 2026-09-22
- Tata Elxsi 用 AWS 打造 IRIS:边缘过滤削减 70-80% 上云帧量 — AWS ML Blog · 2026-09-22
- bitsandbytes2 略延期:零操作"懒压缩"加动态专家换入,逼近无限 KV cache — Tim_Dettmers · 2026-09-22
- 迭代敏感性探测:Dettmers 解释如何逐层逼近模型压缩崩溃边界 — Tim_Dettmers · 2026-09-22
- Tim Dettmers 发布运行时动态压缩框架,实现 1.5-2.0 bit 高质量压缩 — Tim_Dettmers · 2026-09-22
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22