276B大模型端侧部署:单台Mac Studio跑通nvfp4量化
pcuenq · x · 2026-07-31
开发者展示了如何在苹果生态中高效部署最新发布的 Inkling Small (276B参数) 模型。
- 硬件需求大幅降低:通过官方的 nvfp4 检查点,该模型在单台 Mac Studio 上运行时仅需约 150 GB 内存;用户也可以跨两台 128GB 内存的笔记本协同运行。
- 更激进的量化:作者表示未来一两天内通过更激进的量化手段,有望将其完全塞进单台笔记本电脑中。
- 工具支持:目前已在 GitHub 提交 PR,原生支持 nvfp4 和 mxfp4 模型,可通过 mlx-vlm 直接调用推理。
所属事件:Thinking Machines 发布 Inkling-Small 开源模型(23 条相关)→
「Infra」频道最新
- Martin Shkreli 谈 AI 基建交易回撤:4 倍高杠杆下弱手恐慌踩踏 — ivan_bezdomny · 2026-07-31
- AWS 营收同比大增 37%,大幅超出市场预期 — RihardJarc · 2026-07-31
- 太空数据中心竞赛加速,但面临物理定律等挑战 — Grady_Booch · 2026-07-31
- 传 Google 拟为 Anthropic 提供算力担保与芯片支持 — Wonderful_Buffalo_32 · 2026-07-31
- 解析AI实验室商业模式:前沿闭源拼垂直整合,开源打互操作 — kevinsxu · 2026-07-31
- Armored Llama:在安卓手机上轻松跑大模型的开源 App — Sad-Enthusiastic · 2026-07-31