新 MLX 量化方案实测:82G 显存跑赢 95G,Mac 本地多开智能体
WinterCharm · reddit · 2026-08-02
开发者耗时 9 天为苹果 MLX 生态打造了全新的量化方案 WinterMix,并在 M5 Max MacBook Pro (128GB) 上对比了 18 种变体。
- 核心优势:MLX 在苹果芯片上比 llama.cpp 快得多(预填充快约 9 倍,生成快约 20%),但此前的低比特 MLX 量化存在严重的推理降智和幻觉问题。WinterMix 作为原生格式,无需自定义内核即可直接使用。
- 版本表现:WinterMix58(82 GiB)在 2K 和 16K 上下文的困惑度测试中,击败了 94-95 GiB 的 6-bit 主流方案;WinterMix48(68 GiB)在 128G Mac 上可同时驻留 5-8 个 100K token 的 Agent 会话。
- 行为差异发现:作者在测试中发现了一个反直觉现象——统计上困惑度完全相同的两个量化模型,在实际运行中触发“自我打断(如‘等等,让我再检查一下’)”的频率可能相差 2.5 倍。
目前模型权重已基于 Apache 2.0 协议在 Hugging Face 开源。
「编程与Agent」频道最新
- Plannator 发布技能:用 HTML 生成 Agent 交互原型 — tom_doerr · 2026-08-24
- DocketBird MCP 服务器:支持搜索下载法院文档 — modelcontextprotocol · 2026-08-24
- AgentLux MCP 服务器:支持市场和社交流程 — modelcontextprotocol · 2026-08-24
- MongoDB 发布 Agent 工具包,让编码助手精通数据库 — TheTuringPost · 2026-08-24
- 开发软件前先让 Agent 查开源库,99% 的情况是正解 — generativist · 2026-08-24
- 开发者瓶颈不在 AI 上下文,而在人脑认知负荷 — Vidhrohi · 2026-08-24