Qwen 3.8 Flash Next 量化版上 M3 Ultra 跑出 65 tokens/s
ivanfioravanti · x · 2026-09-07
开发者 ivanfioravanti 宣布 Qwen 3.8 Flash Next 已可在 Apple Silicon 上通过 DwarfStar 本地运行,视频演示在 M3 Ultra 上达到 65 tokens/s。
他已将 Q2 量化权重上传到 Hugging Face(ivanfioravanti/Qwen3.8-Flash-Next-DS4-IQ2),并开放了 PR 分支,正在征集拥有 64GB 内存的 Apple Silicon 用户帮忙测试。模型模板显示其支持 xhigh/medium/low 三档 reasoning effort,默认 xhigh。
「Infra」频道最新
- 传AWS将2026年资本开支上调至2200亿美元,加速抢购AI服务器机柜 — firstadopter · 2026-09-07
- Together AI 签下行业最大开源基建协议:25 万芯片、年约 50 亿美元 — togethercompute · 2026-09-07
- 研究拆解 Firecracker jailer 安全层:io_uring 成隔离边界软肋 — jedisct1 · 2026-09-07
- Perplexity 转向端侧:敏感数据交给本地小模型处理 — HowDevelop · 2026-09-07
- Merge Gateway 推出 DeepSeek V4 Flash 七五折:输入每百万 token 仅 4 美分 — shensi · 2026-09-07
- 四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁 — dowitex · 2026-09-07