MLX本地推理选哪款4bit量化?主流方案对比
True_Tangerine_4706 · reddit · 2026-08-09
开发者就苹果 MLX 框架下最优的 4-bit 量化方案发起了讨论。针对 Qwen3.6-27B 等模型,目前社区流行的量化格式包括 OptiQ 4bit、Unsloth dynamic 2.0、oQ 以及原生量化。作者希望集思广益,了解这些主流量化技术在本地推理速度和模型损耗上的实际表现差异。
「Infra」频道最新
- Home Assistant 新版本正式集成 llama.cpp — ngxson · 2026-08-09
- DeepSeek本地部署:投机解码导致极速掉速的排查 — Easy_Werewolf7903 · 2026-08-09
- 解决 AMD 显卡运行 MiniMax H3 输出黑屏问题 — Present-Guitar-3967 · 2026-08-09
- 消费级显卡开启 PCIe P2P,多卡本地部署吞吐量免费提升 25% — BidonPomoev · 2026-08-09
- 美团发布 LongCat 2.0:全程基于国产 ASIC 训练推理 — bycloud · 2026-08-09
- RTX 5090跑MiniMax H3:视频生视频耗时暴涨至20分钟 — Chaztle · 2026-08-09