M2 Ultra 运行 Qwen3.8-27B 速度基准测试实录
planetearth80 · reddit · 2026-08-18
一位用户在配备 192GB 内存的 Mac Studio M2 Ultra 上运行 llama.cpp,对 Qwen3.8-27B (Q6KXL) 量化模型进行了详细的基准测试。帖子列出了具体的编译版本、模型参数、llama-bench 测试标志及结果数据,并分享了实际服务部署时的启动参数配置。作者希望与其他 Mac Ultra 用户对比数据,以优化推理性能。
「Infra」频道最新
- Qwen3.8-27B 去审查量化版发布,FastMTP 推理提速最高 3.02 倍 — hauhau901 · 2026-08-18
- 摩根大通预测2026年AI加速器出货涨62%至1630万 — Beth_Kindig · 2026-08-18
- Ollama 测评:DeepSeek V4 Flash 性能最佳,Qwen 质优但慢 30 倍 — ollama · 2026-08-18
- 2026 智能体爆发推高前沿模型毛利率至 85% — ben_j_todd · 2026-08-18
- Bittensor 联创谈去中心化 AI:像挖比特币一样「挖智能」 — markjeffrey · 2026-08-18
- SGLang 比 vLLM 多占 18.5GB 显存:混合注意力模型实测存疑 — SomeRandomGuuuuuuy · 2026-08-18