在 48GB Mac 上运行 104B Qwen3 模型,速度约 12 tok/s

yogthos · reddit · 2026-09-02

Reddit 用户分享了在 48GB 内存 Mac 设备上运行 Qwen3 8B Flash Next 模型(量化后约 104GB)的实践,推理速度达到每秒约 12 个 token。

相关实现基于 GitHub 上的 slotstream 项目。该方案展示了在受限显存/内存环境下通过量化技术运行较大参数模型的可行性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →