M3 Max 上 4-bit 量化跑 Qwen 3.8:每秒 25 token 已完全可用

AIandDesign · x · 2026-08-19

用户分享在 M3 Max 上以 4-bit 量化本地运行 Qwen 3.8,推理速度约 25 token/秒,虽然后续还会更快,但当前已完全可用——作者称其体验已好于当年本地跑 GPT-4 之前的水准,直呼「WILD」。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →