用 Qwen3-1.7B 初始化统一 DiT 训图像模型,2 天出首批样本

ostrisai · x · 2026-10-08

ostrisai 分享了一项进行中的实验:从 Qwen3-1.7B 语言模型初始化训练一个统一 DiT(扩散 Transformer),使用 FLUX.2 VAE 并做 8x patching,实现总共 64x 空间压缩,输入输出不加投影层,每个 block 直接操作 latent。

关键细节:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →