开源模型已足以上手,端侧部署仍是硬骨头
dscape · x · 2026-08-27
日常使用的 AI 居住在别人的数据中心,每次提示都要往返服务器。开源模型现在已足够在笔记本上运行,但让前沿模型适配消费硬件并快速运行是残酷且不光鲜的工作(量化、写内核、 wrestle)。Prince Canuma 被称为 Apple MLX King,常在开源模型发布当天将其原生跑在 Mac 上。他的库 mlx-vlm 和 mlx-audio 下载量数百万,并与 Google DeepMind 等合作。现在他通过 Neywa Labs 和 Mac 应用 NativAI 实现了一键运行,无需终端。
「Infra」频道最新
- 呼吁社区推广 LoRA 分发以节省下载带宽 — Borkato · 2026-08-27
- GLM-5.3-Flash 本地部署实测:206 tok/s 与 1M 上下文 — funding__secured · 2026-08-27
- Hugging Face 推出 Jobs:按秒计费跑 UV/Docker 任务 — _akhaliq · 2026-08-27
- Merge 联合 PostHog 举办 NYC 技术沙龙,探讨自驱动产品 — shensi · 2026-08-27
- LightningAI 推出即时 H100 租赁,无需等待排队 — LightningAI · 2026-08-27
- M7 Ultra 或搭载原生 FP8,GLM 5.3-flash 性能有望飞跃 — Brilliant-Hall1387 · 2026-08-27