M3 Max 上 4-bit 量化跑 Qwen 3.8:每秒 25 token 已完全可用
AIandDesign · x · 2026-08-19
用户分享在 M3 Max 上以 4-bit 量化本地运行 Qwen 3.8,推理速度约 25 token/秒,虽然后续还会更快,但当前已完全可用——作者称其体验已好于当年本地跑 GPT-4 之前的水准,直呼「WILD」。
「Infra」频道最新
- 开源个人 AI 计算机打造指南:本地化算力方案 — tom_doerr · 2026-08-19
- 从基础设施视角看移除视觉编码器的优势 — liuziwei7 · 2026-08-19
- UC伯淳发布FreeToken:端侧MoE高效推理系统 — UCBerkeley · 2026-08-19
- Cerebras推新推理系统:显著加速聊天机器人响应 — Polymarket · 2026-08-19
- 播客详解 OpenRoboto:去中心化网络训练人形机器人AI — markjeffrey · 2026-08-19
- GitHub 故障催生替代品:基于 Durable Objects 的 Git 仓库服务 — tobowers · 2026-08-19