SenseNova u1.5架构解析:ConvDecoder能否根除网格伪影?

Taylar214 · reddit · 2026-08-11

作者对 SenseNova u1.5 的架构更新进行了深度分析。新版本引入了 ConvDecoder,将视觉 token 转换为 2D 网格并通过像素重排和 3x3 卷积进行上采样,使相邻 patch 在重建图像时能交互信息,旨在解决超高分辨率下的网格伪影和纹理断裂。

然而,作者指出官方公布的图像生成提升得分混淆了多种变量(新解码器、更多训练数据、更优提示词等),缺乏控制变量的消融实验。作者呼吁进行更严谨的对比测试:

此外,作者关注到模型在生成/编辑数据极少包含 JSON 提示的情况下,仍能很好地遵循长结构化提示。这暗示模型从理解任务中学到的结构化能力可能产生了跨任务迁移,辅助了视觉规划,这一发现若经证实将具有重要意义。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →