Mac M4 Max 运行 Qwen 3.8 27B:代码生成达 72 tok/s
TheMoonMidas · x · 2026-08-22
开发者分享在 Mac Studio M4 Max 上优化运行 Qwen 3.8 27B 模型的方案。通过使用 oMLX 0.6.3rc2 框架,结合 ANE (Apple Neural Engine) 进行 Prefill 加速和原生 Multi-Token Prediction (MTP, k=3) 技术,实现了显著的性能提升。实测数据显示:
- 代码生成速度:72.1 tok/s
- 文本生成速度:53.3 tok/s
- Prefill 速度:274 tok/s (提升 3.3 倍)
相比之前的最佳方案,解码速度提升约 11%。所有测试均基于本地环境,无云端调用,并在 GitHub 开源了具体的 Benchmark 数据和配置。
「Infra」频道最新
- SGLang 推出权重缓存守护进程,万卡模型重启加速 16 倍 — xiaosun86 · 2026-08-22
- Agent 循环致上下文膨胀,5% 故障耗掉 25% 成本 — MaverikSh · 2026-08-22
- llama.cpp 发布 v0.2.0,转向语义化版本管理 — PhilippeEiffel · 2026-08-22
- 开源工具 Mark Cleaner:本地移除 AI 文本隐形水印与元数据 — VraserX · 2026-08-22
- 预训练数据重复浪费算力?ICML论文揭示大模型更耐重复 — heghbalz · 2026-08-22
- Marin开源23万亿token预训练数据,可公开下载 — joecole · 2026-08-22