商汤 SenseNova-U1.5 技术报告:免 VAE 原生 4K 图像生成

Secret_Yak2496 · reddit · 2026-09-16

商汤 SenseNova 发布 8B 原生统一模型 SenseNova-U1.5 的技术报告,支持图像理解、生成与编辑,不依赖外部视觉编码器或 VAE,图像直接映射为视觉 token,每个 token 代表 32×32 像素区域。

核心方法:

训练数据:新增 59M 文图对(78 个来源)、约 38M 图像编辑样本,88.2% 有效生成训练量高于 1024²,64.4% 高于 2048²。

报告显示在高分辨率连续性、中英文文字渲染、信息图与编辑保持上均有提升;已知问题包括密集小字、强约束排版、小脸手部以及多参考编辑漂移。模型已在 GitHub 与 Hugging Face 开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →