Unsloth 让 GLM-5.3-Flash 本地推理提速 3.3 倍,128GB 内存可跑 3-bit
danielhanchen · x · 2026-09-04
Unsloth 发布 GLM-5.3-Flash(即 Z.ai 的 ox-alpha,320B 参数、18B 激活的多模态开源模型)本地运行完整指南,并宣布推理提速。
关键信息
- 该模型训练用了 30T tokens,采用稀疏+线性注意力混合架构,降低长上下文服务成本,编码与 agentic 基准号称对标 Claude Opus 4.8
- Unsloth 动态量化:1-bit GGUF 仅 93GB(BF16 为 642GB),保留 71% top-1% 精度;3-bit 小 76%,保留 87% 精度
- 硬件要求:1-bit 需约 100GB RAM,3-bit 需 128GB(如 Mac 或 NVIDIA DGX Spark)
- 新版启用 MTP(多 token 预测)与长上下文解码优化,本地推理提速 1.6–3.4 倍(官方称 3.3 倍)
- 提供 Low/High/Max 三档思考模式,DeepSWE 任务建议 temperature=0.95
可通过 Unsloth Desktop 或 llama.cpp 直接运行,GitHub 与 Hugging Face 均有 GGUF 下载。
「Infra」频道最新
- Kafka 精确一次交付三层机制解析:出 Kafka 即裸奔 — arpit_bhayani · 2026-09-04
- AMD 发布 Threadripper Halo Station:96 核 CPU 配 576GB HBM3E — ccerrato147 · 2026-09-04
- 宾州选民联合抗议数据中心建设:人们要被坑了 — 1vuio0pswjnm7 · 2026-09-04
- 流体基础模型 AeroJEPA 正式加入 NVIDIA PhysicsNeMo 生态 — ricardovinuesa · 2026-09-04
- 2-2.5千欧预算搭建本地 AI 工作站:律师隐私 RAG 与 agentic coding 选型 — whatyathinkk · 2026-09-04
- 双卡 3090 够用吗?本地 LLM 玩家讨论是否再堆两张 — Blues520 · 2026-09-04