GLM-5.3-Flash 量化至 4-bit 仍保留 93% 准确率
amaarora · x · 2026-08-28
GLM-5.3-Flash (ox-alpha) 模型可量化至 4-bit 并保留 93% 的准确率。实测显示,该 4-bit 模型表现接近本地版 Claude 4.7 Opus。模型可在 256GB Mac 或两张 DGX Spark 上完美运行,5-bit 量化可能也可行。UnslothAI 团队还提供了 3-bit 版本(需 128GB RAM)的 GGUF 格式运行指南。
「模型」频道最新
- Qwen4 架构前瞻:27B 模型或现智力飞跃 — Iory1998 · 2026-08-28
- 技术观察:稀疏注意力层可替代全局注意力且无损性能 — stochasticchasm · 2026-08-28
- llama.cpp 合并 Qwen3.8-Flash-Next 支持,GGUF 格式可下载 — jacek2023 · 2026-08-28
- Grok 4.6 在工程科学领域追平 GPT-5.6 Sol — sanmikoyejo · 2026-08-28
- GPT-5.6 Sol 成本仅为 Claude Fable 5 三分之一 — sanmikoyejo · 2026-08-28
- GLM-5.3 即将发布,探讨与 Advisor/Flash 组合使用场景 — mariofilhoml · 2026-08-28