在 M5 Max 128GB 上流式加载 1.6TB K3 权重仍很慢

antirez · x · 2026-07-29

这条帖子的重点是本地推理/加载规模:作者说,直接在 M5 Max 128GB 上流式加载 K3 官方 Hugging Face 权重还是“有点慢”。

值得注意的是模型体量本身——它提到的是 1.6TB 的权重,而且是 mxfp4 格式,属于很典型的基础设施/端侧部署讨论。

所属事件:极客尝试在 Mac 设备本地量化运行 K3 大模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →