纯 MLX 跑通 Nemotron Omni:Mac 端实现视觉音频推理
divinetribe1 · reddit · 2026-08-07
Nvidia 开源的 Nemotron Omni 模型支持视觉和音频推理,但此前的 4-bit MLX 量化版本在 Mac 上只能加载文本部分。为了解决这一问题,作者用纯 MLX 重写了该模型的视觉塔、音频塔及相关处理器。
- 实现细节:从 Nvidia 的 PyTorch 参考实现完整移植,语言模型使用 4-bit 量化,视觉和音频塔使用 bf16。
- 精度验证:所有组件均在相同输入和权重下与 PyTorch 参考进行对比测试,23 项测试全部通过,音频和视觉的余弦相似度极高(接近 1.0)。
- 性能表现:在 M5 Max 机型上,处理图像时速度为 67.7 tok/s,音频为 147 tok/s,纯文本为 152 tok/s。图像处理路径的峰值内存约为 22.1GB,可完美运行于 32GB 内存的 Mac 设备上。代码已开源。
「Infra」频道最新
- 曝 SpaceX 拟砸 168 亿美元建超级工厂,剑指 1 太瓦算力 — ChrisGPT · 2026-08-07
- 高性能工程核心:性能分析才是证明代码更快的利器 — Abhishekcur · 2026-08-07
- 台积电亚利桑那州晶圆厂罕见曝光 ASML EUV 光刻机 — saibharadwaj · 2026-08-07
- AI 推动三大云厂商支出激增,Neoclouds 崛起抢食算力 — DavidLinthicum · 2026-08-07
- RTX 5070 Ti 跑 MiniMax H3 视频生成,非采样开销高达 240 秒 — orlandogourmet66 · 2026-08-07
- AWS 推出 Bedrock AgentCore 网关速率限制功能 — AWS ML Blog · 2026-08-07