320B 模型跑上 Mac:OrcaSAQ 量化法让 GLM-5.3 落地苹果芯
alejandroll10 · x · 2026-08-27
OrcaRouter 宣布将 320B 参数的 GLM-5.3-Flash 原生引入 Apple Silicon。为此团队发明了 OrcaSAQ(Orca 敏感度感知量化)方法,支持 2/3/4/6-bit 原生 MLX 量化,无需校准且感知架构。在 6-bit 量化下,其 Top-1 准确率相比 FP8 达到 97.76%,实现了接近 FP8 的保真度与大幅降低的显存占用。
「Infra」频道最新
- 预测:单台桌面机将能运行 k3 级模型 — AaronBergman18 · 2026-08-27
- Anthropic 拟斥资 450 亿美元锁定 460MW 算力,GPU 均价曝光 — zephyr_z9 · 2026-08-27
- Kioxia 拟投资 1 万亿日元在岩手县建第三座晶圆厂 — zephyr_z9 · 2026-08-27
- DeepSeek-V4-Flash 推理提速至 51.5 tok/s — antirez · 2026-08-27
- Colibrì 引擎升级:支持 2.8T 参数模型,显存吞吐暴增 — solyarisoftware · 2026-08-27
- 黄仁勋:500 亿美元数据中心投资回本周期不到一年 — zephyr_z9 · 2026-08-27