GLM-5.3-Flash 极致量化版跑上 DGX Spark,带视觉 18-25 tok/s
pbaylies · x · 2026-09-08
开发者 0xSero 发布了适配单台 NVIDIA DGX Spark 的 GLM-5.3-Flash 量化版本(EXL3 TR3,2.0bpw,未剪枝),已验证可用,开启视觉能力时推理速度达 18-25 tok/s。模型权重已上传 HuggingFace,并附完整 chat template 配置,作者征集社区测试反馈。这是把大参数模型压进 128GB 统一内存设备的又一社区实践。
「Infra」频道最新
- Lerna 插件破解 Copilot HydraFusion,可把模型调用路由到 Azure — unixterminal · 2026-09-08
- Reactor 携手 NVIDIA SANA 上线 MiniMax FastH3,视频生成首次超实时 3 倍 — flngr · 2026-09-08
- NVIDIA 推出 H3 新加速方法,社区催 ComfyUI 适配 — krigeta1 · 2026-09-08
- AI 机柜光互连供应链拆解:InP 衬底与硅光或是更干净的上游布局 — demian_ai · 2026-09-08
- 双卡 7900 XTX 跑 40B 级本地模型,X570/X870 方案可行吗 — espece-de-bon · 2026-09-08
- Hugging Face 自研 WebGPU 推理引擎亮相:实验提速 5-10 倍 — nicodotdev · 2026-09-08