自制视频模型用 Wan 2.1 1.3B 做全局块

ostrisai · x · 2026-07-27

作者在尝试做一个像素空间视频模型:以 Wan 2.1 1.3B 作为全局块,在两端加入改造过的 hourglass transformer block。

目前还在做 hourglass 的预训练。文中给出的关键设计是:全局块使用了等效 16 倍空间压缩 和 8 倍时间压缩,说明这是一个压缩率很高的视频表示方案。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →