Unsloth 让 GLM-5.3-Flash 本地推理提速 3.3 倍,128GB 内存可跑 3-bit

danielhanchen · x · 2026-09-04

Unsloth 发布 GLM-5.3-Flash(即 Z.ai 的 ox-alpha,320B 参数、18B 激活的多模态开源模型)本地运行完整指南,并宣布推理提速。

关键信息

可通过 Unsloth Desktop 或 llama.cpp 直接运行,GitHub 与 Hugging Face 均有 GGUF 下载。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →