在 48GB Mac 上运行 104B Qwen3 模型,速度约 12 tok/s
yogthos · reddit · 2026-09-02
Reddit 用户分享了在 48GB 内存 Mac 设备上运行 Qwen3 8B Flash Next 模型(量化后约 104GB)的实践,推理速度达到每秒约 12 个 token。
相关实现基于 GitHub 上的 slotstream 项目。该方案展示了在受限显存/内存环境下通过量化技术运行较大参数模型的可行性。
「Infra」频道最新
- Ilya 警告:云厂商需加强防备 AI 夺权 — _AndrewZhao · 2026-09-02
- 网友质疑:为何仍用不懂建沙盒的公司? — basedjensen · 2026-09-02
- OpenAI Jalapeño芯片架构深度解析:与英伟达对比 — thehiphopswami · 2026-09-02
- Nous Research 发布 Portal 平台整合 Agent 生态 — Teknium · 2026-09-02
- 谷歌签 396 兆瓦地热协议,为犹他数据中心供电 — natesiggard · 2026-09-02
- YC Paper Club 征集演讲:探讨光计算、钻石芯片与生物 GPU — ycombinator · 2026-09-02