商汤发布 SenseNova-U1.5:8B 无编码器统一模型实现理解生成一体
KyeGomezB · x · 2026-09-14
商汤团队发布 SenseNova-U1.5,一个 8B-MoT 原生统一多模态模型,采用 encoder-free、VAE-free 架构,在像素空间直接完成图像理解、推理、生成与编辑,支持原生 4K 分辨率生成。
关键做法:
- 通过空间连贯的 patch 重建强化视觉接口,配合精心筛选的生成与编辑数据扩展训练
- 后训练阶段分别优化视觉美学、双语文字渲染、信息图生成、图像编辑四个专项 RL 专家,再用多专家 on-policy 蒸馏合并回单一模型
- 评测显示图像保真度、文字渲染、复杂构图、多参考编辑与交错生成均大幅提升,同时保持指令跟随、主体身份与未修改区域不变
论文以此论证视觉理解与生成可以共享同一原生表征,而非分离的两套系统。
「多模态」频道最新
- Marigold V2 用 4-bit QLoRA 微调 Qwen-Image-Edit,单卡数日搞定稠密预测 — RexDouglass · 2026-09-14
- 开源 stage-gen 实测:自动绑定骨骼仍会在动画中变形翻车 — softmarshmallow · 2026-09-14
- 用「GPT-6 Astra」加 fal 相机控制复刻童年漫画英雄 — OdinLovis · 2026-09-14
- AI 生成动画激战:爆裂 Rari 大战哀鸣 Argent 引围观 — abokalypsis · 2026-09-14
- 谷歌用AI帮 filmmakers 重建老夫妇从未被记录的初遇 — VraserX · 2026-09-14
- 3060 12GB 本地跑图生视频:作者实测 Wan2.2 后求替代方案 — Legal-Respond-6725 · 2026-09-14