单卡3.5天从零训练2.1亿参数文生图DiT,三项实测发现
IvanMikhnenkov · reddit · 2026-09-11
作者在单张 RTX PRO 6000 上用 3.5 天、420 万张 256² 图像从零训练了一个 2.1 亿参数的 cross-attention DiT 文生图模型(rectified flow + logit-normal 时间步 + shift 2.8),目的是吃透完整配方。三个少见被明说的实测结论:
- 学习到的 null attention slot 成了注意力汇聚点:2 个学习的 K/V 槽在中层拿到约 90% 的 cross-attention 权重,EOS token 降到约 4%,register 向量范数涨到图像 token 的 4–13 倍。
- flow-matching loss 是健康信号而非质量信号:loss 仅从 0.805 降到 0.754,但 FID 33.7→27.0、FD-DINOv2 570→218、物体准确率 65%→90%。
- 训练期 timestep shift 比翻倍步数更值钱:20 步 + shift 2.8 达 FID 27.0,50 步才 26.6,不加 shift 则退化。
训练细节:896×16 blocks、2D RoPE、QK-norm、adaLN-single,flan-t5-base 冻结,batch 256 训 40 万步,torch.compile 带来 2.4× 提速。代码、权重、demo 均已开源,下一步计划在该基座上跑 Flow-GRPO。
「多模态」频道最新
- 开源音乐生成模型 YuE2 发布,部分基准超过 Mureka v9 和 MiniMax 3 — _AustinCalvert_ · 2026-09-11
- 同提示词同种子,Anima 与 SDXL 出图质量差在哪 — nano_chad99 · 2026-09-11
- Synthesia 上线自定义 Avatar:文字提示即可生成虚拟主播 — synthesiaIO · 2026-09-11
- Storyboard:开源AI视频工作流项目 — chodtoo · 2026-09-11
- CapCut 桌面版上线 Seedance 2.5,单次生成 30 秒视频 — anthara_ai · 2026-09-11
- Marigold V2 发布:单步扩散 Transformer 刷新单目深度估计 SOTA — AntonObukhov1 · 2026-09-11