用 Qwen3-VL 文本编码器训练 Wan 2.1 视频模型

ostrisai · x · 2026-07-05

开源开发者 ostrisai 进行实验,将视频生成模型 Wan 2.1-1.3B 适配 Qwen3-VL-2B 视觉语言文本编码器,按文本、VL、两者混合各 33% 的比例训练,目前仅预训练两个文本输入线性层。他指出模型适配新文本编码器速度极快,已完成 25750 步(BS=10)训练。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →