GLM-5.3-Flash 极致量化版跑上 DGX Spark,带视觉 18-25 tok/s

pbaylies · x · 2026-09-08

开发者 0xSero 发布了适配单台 NVIDIA DGX Spark 的 GLM-5.3-Flash 量化版本(EXL3 TR3,2.0bpw,未剪枝),已验证可用,开启视觉能力时推理速度达 18-25 tok/s。模型权重已上传 HuggingFace,并附完整 chat template 配置,作者征集社区测试反馈。这是把大参数模型压进 128GB 统一内存设备的又一社区实践。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →