基于 GLM-5.2 的视觉语言模型在 Hugging Face 走红

baseten · hf · 2026-07-23

baseten/GLM-5.2-Vision-NVFP4 在 Hugging Face 上进入趋势榜,类型是 image-text-to-text 多模态模型。

从条目看,它使用了 sglang、safetensors,并基于 zai-org/GLM-5.2,说明这是一个面向图文输入输出的 GLM 视觉语言版本,而不是纯文本模型。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →