Qwen 3.8 在 M 系列芯片跑出 45+ T/ps,作者详解调优参数
Adventurous_Cat_1559 · reddit · 2026-08-21
作者分享了在 M 系列芯片上运行 Qwen 3.8 (8bit 量化) 的优化经验,通过反复试错实现了 45+ 稳定 T/ps 的吞吐量,成为该模型在 M 系列芯片上的最高记录。全文链接了具体的 benchmark 页面和详细的启动参数配置,并标注了哪些设置有效、哪些无效。作者表示在实际编码测试中未发现性能与默认配置有显著差异。
「Infra」频道最新
- NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s — PyTorch · 2026-08-21
- SpaceX 发射频率或助太空算力达 12-50GW — teortaxesTex · 2026-08-21
- 本地 AI 编码硬件分级:1000 美元起跑 27B 模型 — nickbaumann_ · 2026-08-21
- Cerebras 高管申报出售 1.53 亿美元股票,IPO 追高散户被重创 — firstadopter · 2026-08-21
- Fable 推出企业级安全护栏,支持本地基础设施部署 — trq212 · 2026-08-21
- IOTA SN9 测试异构 GPU 联网训练 16B 模型 — bittingthembits · 2026-08-21