用 Qwen3-VL 文本编码器训练 Wan 2.1 视频模型
ostrisai · x · 2026-07-05
开源开发者 ostrisai 进行实验,将视频生成模型 Wan 2.1-1.3B 适配 Qwen3-VL-2B 视觉语言文本编码器,按文本、VL、两者混合各 33% 的比例训练,目前仅预训练两个文本输入线性层。他指出模型适配新文本编码器速度极快,已完成 25750 步(BS=10)训练。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11