在 M5 Max 128GB 上流式加载 1.6TB K3 权重仍很慢
antirez · x · 2026-07-29
这条帖子的重点是本地推理/加载规模:作者说,直接在 M5 Max 128GB 上流式加载 K3 官方 Hugging Face 权重还是“有点慢”。
值得注意的是模型体量本身——它提到的是 1.6TB 的权重,而且是 mxfp4 格式,属于很典型的基础设施/端侧部署讨论。
所属事件:极客尝试在 Mac 设备本地量化运行 K3 大模型(2 条相关)→
「Infra」频道最新
- 中国半导体推进加速:浸没式 DUV 与近美光级 DRAM 产能 — Distinct-Question-16 · 2026-07-29
- 低显存 LoRA 训练已可把 DeepSeek-V4-Flash 装进 90GiB 显存 — woct0rdho · 2026-07-29
- YC 初创 hwintelligence 推出带验证 agent 的波形调试器 — ycombinator · 2026-07-29
- Broadcom 说 AI 可能把漏洞利用窗口从几周压到几小时 — therealdanvega · 2026-07-29
- camelAI 把 agent 从虚拟机迁到 Cloudflare Durable Object — irvinebroque · 2026-07-29
- LLM 推理手册汇总生产部署、选卡与优化指南 — carrycooldude · 2026-07-29