NVIDIA 上架 GLM-5.3-Flash NVFP4 量化版,登 HF 热门
nvidia · hf · 2026-09-16
NVIDIA 在 Hugging Face 发布了 GLM-5.3-Flash 的 NVFP4(INT4 FP4)量化版本,登上热门模型榜。该模型为图像-文本到文本的多模态模型,使用 Model Optimizer(ModelOpt)工具链量化,提供 safetensors 格式,便于在 NVIDIA 硬件上以 FP4 精度部署推理、降低显存占用。
「Infra」频道最新
- El Pulpo 0.1.0 发布:12.7MB 的本地 LLM 代理与负载均衡器 — zaytzev · 2026-09-16
- CPO 峰会共识:光互连规模化的答案不会是单一方案 — BenBajarin · 2026-09-16
- arXiv 新论文提出 Intelligence per Watt:量化本地 AI 的智能能效 — yogthos · 2026-09-16
- 开发者拆解 X 搜索排序架构:双塔检索 + L1/L2 多级排序 — _jaydeepkarale · 2026-09-16
- 连竞价型 8xH100 实例都租不到,GPU 短缺再加码 — bingxu_ · 2026-09-16
- 自采数据+定制中训+自跑 RL,推理价格只要 Astra max 一半 — hsu_byron · 2026-09-16