NVIDIA 上架 PixelUMM:基于 Qwen3-8B 的图文视频理解模型
nvidia · hf · 2026-10-02
NVIDIA 在 Hugging Face 上发布了新模型 PixelUMM,基于 Qwen3-8B 微调,pipeline 为 image-to-text,支持图像理解、视频理解以及图文/视频+文本到文本的多模态任务。模型采用自定义许可证(other license),区域标注为美国。发布页暂附完整技术细节,可作为 NVIDIA 在多模态理解方向的最新动作关注。
所属事件:NVIDIA 发布免编码器统一多模态模型 PixelUMM(3 条相关)→
「模型」频道最新
- ChatGPT Pro 500 档英国定价曝光:£445 约合 589 美元 — koltregaskes · 2026-10-02
- 开源编码 Agent Z-Engine:用 System 1 模型接管小决策 — arshadbarves · 2026-10-02
- 测试 8 个顶级模型:长周期经营任务 AI 仅达人类 27.3% 水平 — rohanpaul_ai · 2026-10-02
- ChatGPT 付费账号明早 10 点全球用量重置,GPT-6.1 恢复正常速度 — Angaisb_ · 2026-10-02
- 「Google 不会查证」背后:AI Overview 总结是否经过事实核查? — daluoseo · 2026-10-02
- 预测市场实测:Liquid AI 的 D1 分类器 12 类中赢 9 类 — JosephJacks_ · 2026-10-02