极客尝试在 Mac 设备本地量化运行 K3 大模型
针对庞大的 K3 模型权重,开发者们正在探索本地与近端推理方案。测试发现,在 M5 Max 128GB 上流式加载 1.6TB 的官方权重依然缓慢;但通过量化手段,使用两台 512GB 内存的 Mac Studio 跑 Q2 精度,已能在聊天场景中达到可接受的响应速度,证明了量化运行的可行性。
2026-07-29 ~ 2026-07-29 · 2 条相关
- 在 M5 Max 128GB 上流式加载 1.6TB K3 权重仍很慢 — antirez · 2026-07-29
- 两台 512GB Mac Studio 可跑 Q2 聊天,K3 也许适合量化 — antirez · 2026-07-29