用 Qwen3-1.7B 初始化统一 DiT 训图像模型,2 天出首批样本
ostrisai · x · 2026-10-08
ostrisai 分享了一项进行中的实验:从 Qwen3-1.7B 语言模型初始化训练一个统一 DiT(扩散 Transformer),使用 FLUX.2 VAE 并做 8x patching,实现总共 64x 空间压缩,输入输出不加投影层,每个 block 直接操作 latent。
关键细节:
- 采用 X0 预测,并用交替的 padding/slicing block 方案来克服 patch 伪影,效果出乎意料地好
- 该技巧的前提是不用投影层,即 latent 通道数必须与 hidden state 尺寸一致
- 训练速度快、初步样本(2 天)效果不错;作者已启动第二个实验:从剪枝到 4B 的 Hidream-01 初始化,改用 Wan 2.1 VAE + patch 16,达到 128x 空间压缩和 4x 时间压缩
「多模态」频道最新
- ElevenLabs 11 个语音模型登陆 OpenRouter,限时五折 — lukeharries · 2026-10-08
- Nano Banana 2.1 疑似上线 Google Flow,一句提示词生成电影倒序拼贴 — socialwithaayan · 2026-10-08
- 社交平台流传一组 Nano Banana 2.1 生成图片 — socialwithaayan · 2026-10-08
- Nano Banana 2.1 发布次日刷屏,文字与角色一致性大升 — socialwithaayan · 2026-10-08
- LiveAvatar 新增 30 个全身数字人:6 种情绪更自然表情 — aftahi_ai · 2026-10-08
- 开发者实测 AI 生成游戏:模型变强了,但点子还是老一套 — zeeg · 2026-10-08