Qwen 3.8 Flash Next 量化版上 M3 Ultra 跑出 65 tokens/s

ivanfioravanti · x · 2026-09-07

开发者 ivanfioravanti 宣布 Qwen 3.8 Flash Next 已可在 Apple Silicon 上通过 DwarfStar 本地运行,视频演示在 M3 Ultra 上达到 65 tokens/s。

他已将 Q2 量化权重上传到 Hugging Face(ivanfioravanti/Qwen3.8-Flash-Next-DS4-IQ2),并开放了 PR 分支,正在征集拥有 64GB 内存的 Apple Silicon 用户帮忙测试。模型模板显示其支持 xhigh/medium/low 三档 reasoning effort,默认 xhigh。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →