NVIDIA 上架 PixelUMM:基于 Qwen3-8B 的图文视频理解模型

nvidia · hf · 2026-10-02

NVIDIA 在 Hugging Face 上发布了新模型 PixelUMM,基于 Qwen3-8B 微调,pipeline 为 image-to-text,支持图像理解、视频理解以及图文/视频+文本到文本的多模态任务。模型采用自定义许可证(other license),区域标注为美国。发布页暂附完整技术细节,可作为 NVIDIA 在多模态理解方向的最新动作关注。

所属事件:NVIDIA 发布免编码器统一多模态模型 PixelUMM(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →