GLM-5.3-Flash 本地运行指南:128GB 内存跑 3-bit 量化
StefanoGogioso · x · 2026-08-27
Z.ai 发布的 GLM-5.3-Flash (320B 参数) 现支持本地运行。Unsloth 提供了 GGUF 量化版本,1-bit 版本需 100GB 内存(保留 71% 精度),3-bit 版本需 128GB 内存(保留 87% 精度)。该模型在 DeepSWE 编程和代理基准测试中媲美 Claude Opus 4.8,采用混合稀疏线性注意力架构降低成本。
「Infra」频道最新
- 一台 DGX Spark 能同时服务多少人?社区征集真实数据 — edge_compute_user · 2026-08-27
- Unsloth 被请求用 UD 3.0 重量化 Qwen 旧版模型 — Fancy-Snow7 · 2026-08-27
- QNX 携手 Hailo 做边缘 Physical AI:性能一致性提升 14 倍 — pdamodaran · 2026-08-27
- 美企算力优势达 15-20 倍,但在特定威胁下或无效 — ohlennart · 2026-08-27
- Hark 宣布与 NVIDIA 合作,获千兆级算力支持多模态系统 — adcock_brett · 2026-08-27
- Minimax H3 本地部署实测:5秒片段需4分钟 — thevictor390 · 2026-08-27