SenseNova u1.5架构解析:ConvDecoder能否根除网格伪影?
Taylar214 · reddit · 2026-08-11
作者对 SenseNova u1.5 的架构更新进行了深度分析。新版本引入了 ConvDecoder,将视觉 token 转换为 2D 网格并通过像素重排和 3x3 卷积进行上采样,使相邻 patch 在重建图像时能交互信息,旨在解决超高分辨率下的网格伪影和纹理断裂。
然而,作者指出官方公布的图像生成提升得分混淆了多种变量(新解码器、更多训练数据、更优提示词等),缺乏控制变量的消融实验。作者呼吁进行更严谨的对比测试:
- 单独对比旧版独立 patch 重建与新版 ConvDecoder。
- 在 1K、2K、4K 分辨率下专门测量边界处理效果。
- 进行频域分析,并在全新视觉域上微调以观察伪影是否复发。
此外,作者关注到模型在生成/编辑数据极少包含 JSON 提示的情况下,仍能很好地遵循长结构化提示。这暗示模型从理解任务中学到的结构化能力可能产生了跨任务迁移,辅助了视觉规划,这一发现若经证实将具有重要意义。
「多模态」频道最新
- MiniMax H3实测:超长结构化提示词精准控制视频运镜 — lolo780 · 2026-08-11
- Grok多模态工作流实测:图像生成直通3D建模 — Daniel_Farinax · 2026-08-11
- AI生成赛博朋克谍战动作短片《The Drop》 — VIV-AF-D · 2026-08-11
- 巨型天线宝宝大肆破坏,AI视频生成再现离谱名场面 — cocktailpeanut · 2026-08-11
- MiniMax H3视频生成:Turbo LoRA与频谱微调哪个更好? — Leonviz · 2026-08-11
- RTX 5090实测:跑MiniMax H3生成60秒长视频 — Sn0opY_GER · 2026-08-11