NVIDIA 等发布 PixelUMM:去 VAE 与视觉编码器的像素空间统一多模态模型
CSProfKGD · x · 2026-10-02
NVIDIA 与滑铁卢大学团队发布 PixelUMM,一个无编码器(encoder-free)的统一图像/视频理解与生成模型,代码和权重已开源。
- 核心思路:抛弃 VAE 和 ViT 视觉编码器,用单个 decoder-only Transformer 直接读写原始像素——图像切成 16×16 patch,视频用 4 帧 tube 表示。
- 架构:骨干为 Qwen3-8B,理解与生成各设独立 expert,共享一个覆盖文本、干净像素和加噪像素的 self-attention。
- 实证发现:论文按 F1–F8 八组实验展开消融。其中 F3 揭示线性像素头在高 CFG(约 6)下会在天空等低纹理区域产生网格状 patch 伪影;当前发布的 checkpoint 和在线 demo 仍默认使用线性头,换成卷积头需进一步训练。
- 项目页、论文与模型均公开,是该方向(encoder-free 统一多模态)的代表性工作。
所属事件:NVIDIA 发布免编码器统一多模态模型 PixelUMM(3 条相关)→
「多模态」频道最新
- 开发者用Claude Code Skill一句话生成AI智能体宣传片 — yihui_indie · 2026-10-02
- LeCun 转发 Photoroom 试穿 demo:衣服实时上身,转化升退货降 — ylecun · 2026-10-02
- 一条 prompt 让 Claude Opus 5.5 自主拍出 5 分半 AI 恐怖短片 — Cheap_Credit_3957 · 2026-10-02
- 放弃完美像素:作者用 MiniMax H3 在 3060 上 6 分钟产出 15 秒镜头 — Support_Marmoset · 2026-10-02
- MachGen 让 MiniMax H3 突破 15 秒上限,实现 30 秒连续视频 — MiniMax_AI · 2026-10-02
- FLUX 3 Image 发布:像素级控制、多轮精修、4K 与 10 张参考图 — Friendly-Fig-6015 · 2026-10-02