WinterMix: 3-bit MLX 量化新方法,长文本性能超越 GGUF
WinterCharm · reddit · 2026-08-10
开发者 WinterCharm 发布了针对 Qwen3.5-122B-A10B 模型的新量化版本 WinterMix38(59 GiB,3-bit)。这是一种原生 MLX 格式的量化方法,无需自定义内核或修改运行时即可在 LM Studio 等环境直接加载。
作者指出,虽然 MLX 在 Apple Silicon 上的预填充速度比 llama.cpp 快约 9 倍,但低于 6-bit 的传统 MLX 量化模型质量较差。WinterMix 通过对推理轨迹进行新的退火处理,显著提升了低比特率下的表现。
基准测试表明,在 16K 上下文中,WinterMix38 的困惑度甚至优于 Unsloth 最好的 3-bit GGUF 模型。在超长上下文(如 48K 和 96K)测试中,WinterMix38 的优势进一步扩大,相比 imatrix 格式最高实现了 5.7% 的困惑度降低。模型权重已开源。
「Infra」频道最新
- 告别盲跑:新工具 specspecs 让投机解码拒绝率可视化 — HamelHusain · 2026-08-10
- 索尼与台积电豪掷63亿美元,在日本熊本建先进图像传感器厂 — pstAsiatech · 2026-08-10
- RTX 4060 Ti 实测跑通视频生成:Qwen3-vl 结合 MiniMax-H3 耗时26分钟 — LuisaPinguinnn · 2026-08-10
- 实测:双机集群跑 DeepSeek V4 Flash 完美通过 22 项编码测试 — AccBalanced · 2026-08-10
- 算力账本揭秘:本地跑大模型比云端 API 贵太多 — TheZachMueller · 2026-08-10
- Marvell 推动数据中心解耦:AI 内存与算力将独立采购 — shashib · 2026-08-10