基于 GLM-5.2 的视觉语言模型在 Hugging Face 走红
baseten · hf · 2026-07-23
baseten/GLM-5.2-Vision-NVFP4 在 Hugging Face 上进入趋势榜,类型是 image-text-to-text 多模态模型。
从条目看,它使用了 sglang、safetensors,并基于 zai-org/GLM-5.2,说明这是一个面向图文输入输出的 GLM 视觉语言版本,而不是纯文本模型。
「多模态」频道最新
- OpenArt AI 把土星视频放大成了更精致的太空画面 — theomitsa · 2026-07-24
- GlobalGPT 把聊天、图像、视频和智能体工具整合到一个平台 — SarahAnnabels · 2026-07-24
- FLUX 3 只凭一句提示词就会自己设计镜头 — venturetwins · 2026-07-23
- FLUX 3 模型早期测试展示放出 — MFGREBEL · 2026-07-23
- 开源 LoRA 训练工具:本地或云端从零制作 LoRA — Ill-Ant-9489 · 2026-07-23
- 不依赖 LoRA 与 ControlNet,如何用提示词控制 ComfyUI 人体结构 — mega_lova_nia · 2026-07-23