极客尝试在 Mac 设备本地量化运行 K3 大模型

针对庞大的 K3 模型权重,开发者们正在探索本地与近端推理方案。测试发现,在 M5 Max 128GB 上流式加载 1.6TB 的官方权重依然缓慢;但通过量化手段,使用两台 512GB 内存的 Mac Studio 跑 Q2 精度,已能在聊天场景中达到可接受的响应速度,证明了量化运行的可行性。

2026-07-29 ~ 2026-07-29 · 2 条相关