单卡 3.5 天从零训练 210M 文生图模型,作者公开全部配方与权重
IvanMikhnenkov · reddit · 2026-09-10
作者为获得从零训练 flow 模型的一手经验,自行构建并训练了一个 210M 参数的 diffusion transformer:420 万张精选 256² 图像、在 FLUX.2 VAE 上做 rectified flow、用 flan-t5-base 做文本编码(最长 128 token)。仅 VAE 和文本编码器为预训练冻结组件,transformer、配方、数据管线与评测均为原创。整个训练在单张 RTX PRO 6000 上跑了 3.5 天。
按重要性排序的经验:
- 图文匹配的 caption 最关键:网页爬取的 caption 让模型变差,换成带优质 caption 的精选照片后修复。
- 针对 32 通道 latent 做 timestep shift,并从一开始就按长宽比分桶而非方形裁剪。
- 注册 token 使用可学习的 null attention 槽位,结果 null 槽吸收了约 90% 的 cross-attention,出乎意料。
- torch.compile 用于训练(不只推理):提速 2.4×。
- 第一天后训练 loss 就不再有信息量而图像持续变好,因此改用 FID、检测器目标准确率和人类偏好模型来跟踪。
已开源:权重(CC BY-NC)、代码、每项决策的依据、训练仪表盘与 attention playground,并提供浏览器在线试玩。下一步计划用 Flow-GRPO 做 RL 微调,以失败样本网格作为目标列表。
「多模态」频道最新
- MiniMax-H3 视频 LoRA 上 Hugging Face 热榜,可接入 ComfyUI — Alissonerdx · 2026-09-10
- 蚂蚁系 inclusionAI 开源 LLaDA-Image,文生图支持中英双语 — inclusionAI · 2026-09-10
- Echo-17:工作室首部 AI 生成动漫短片《Kage & Gage》 — finalbosu · 2026-09-10
- Pruna AI 视频模型 P-Video-2 上线 Runware,1080p 最长 20 秒 — aziz4ai · 2026-09-10
- ElevenLabs 与环球音乐达成多年合作,首个大厂牌 AI 音乐授权 — charis_ai · 2026-09-10
- 用 Hailuo H3 生成城市延时摄影,作者公开完整提示词 — azed_ai · 2026-09-10