两台 512GB Mac Studio 可跑 Q2 聊天,K3 也许适合量化
antirez · x · 2026-07-29
这条主要在讲大模型本地/近端推理的折腾经验:作者说,用 两台 512GB 的 Mac Studio 跑 Q2,至少在聊天场景里已经能达到可接受速度。
他还提到 K3 是用 MXFP4 训练的,因此很可能比较适合量化;自己也在等第二台 Mac Studio 512GB 到位。回复里还有人直接在 M5 Max 128GB 上流式加载官方 Hugging Face 的 1.6TB K3 权重,虽然慢但能跑。整体是一次很典型的本地推理、量化和算力配置实测。
所属事件:极客尝试在 Mac 设备本地量化运行 K3 大模型(2 条相关)→
「Infra」频道最新
- 退役 NVIDIA 老卡拼出约 165 美元本地 AI 服务器 — blelbach · 2026-07-29
- 廉价本地智能将把 AI 工作负载从云端分流 — PeterDiamandis · 2026-07-29
- AI 开支与推理需求扩张,AMD 利润被看多 10 倍 — AccBalanced · 2026-07-29
- Cradle Codec 把 KV cache 压缩后经以太网跨节点传输 — knowrohit07 · 2026-07-29
- Bittensor 将 q 提至 0.75,放松中游 subnet 的发放门槛 — markjeffrey · 2026-07-29
- OpenRouter 的壁垒来自路由数据和持续迭代工具链 — mmurph · 2026-07-29