极客尝试在 Mac 设备本地量化运行 K3 大模型
针对庞大的 K3 模型权重,开发者们正在探索本地与近端推理方案。测试发现,在 M5 Max 128GB 上流式加载 1.6TB 的官方权重依然缓慢;但通过量化手段,使用两台 512GB 内存的 Mac Studio 跑 Q2 精度,已能在聊天场景中达到可接受的响应速度,证明了量化运行的可行性。
2026-07-29 ~ 2026-07-29 · 2 条相关
- 第 1 集:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(2026-07-27,11 条)
- 第 2 集:Fireworks 平台上线 Kimi K3 推理与多维微调功能(2026-07-28,2 条)
- 第 3 集:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(2026-07-28,8 条)
- 第 4 集:Kimi K3 开放权重发布,引爆开源与基础设施讨论(2026-07-28,5 条)
- 第 5 集:算力账本:Kimi K3 自托管百天内回本(2026-07-28,4 条)
- 第 6 集:极客尝试在 Mac 设备本地量化运行 K3 大模型(2026-07-29,2 条)
- 第 7 集:Kimi K3 开源 2.8 万亿参数推高算力门槛(2026-07-29,3 条)
- 第 8 集:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2026-07-29,2 条)
- 第 9 集:Kimi K3开源首日获vLLM及AMD等多平台支持(2026-07-30,14 条)
- 在 M5 Max 128GB 上流式加载 1.6TB K3 权重仍很慢 — antirez · 2026-07-29
- 两台 512GB Mac Studio 可跑 Q2 聊天,K3 也许适合量化 — antirez · 2026-07-29