单卡两天从零训出 441M 参数文生图模型:无 VAE 无文本编码器
ostrisai · x · 2026-09-08
ostrisai 周末开始在单张本地 GPU 上从零训练一个纯实验性的图像扩散模型,两天后架构出人意料地有效。设计要点:
- 无文本编码器:直接用 Qwen3 tokenizer 的 token embedding 与图像 token 拼接(时间条件记为 0),只用 self-attention。
- 像素空间直通:patch 16 直接进 transformer,无投影层,hidden size 768 的模块直接处理像素而非投影后的图像 embedding。
- shuffler 修 patch 缝隙:可见的 patch 痕迹通过交替 unpatching、四周 mirror padding 8 后重新 patch(让接缝落在 patch 中心)再过 block、depatch、裁剪、隔块重新 patch 的方式解决,加入后瑕疵立即消失——这是只有去掉投影层才可能的做法。
- 极小极快:总参数仅 441M(其中 116M 是 token embedding 表),对比 SD 1.5 的 983M(TE+UNet),且无 VAE、无文本编码器。
作者不确定最终能否生成连贯图像,但模型已开始理解 prompt 基本概念,效果隐约接近 AITK 同 prompt 的样本。他计划继续训练验证。
「研究」频道最新
- FactoSR:用强化学习分解 4D 属性提升空间推理 — HKUST-GZ2 · 2026-09-08
- 斯坦福团队研究:通用编码 Agent 已碾压手工数据 Agent 达 37 分 — CShorten30 · 2026-09-08
- Dhenu Vision 1.0 公开基准:参考图精确率 94.4% 超所有通用模型 — DevDminGod · 2026-09-08
- NBER 论文:自动化在取代岗位前,先偷走工作的意义 — ArtificialOther · 2026-09-08
- 41.7 万参数 RNN 从单一初始状态自生成 6500 帧 Bad Apple — SEBADA321 · 2026-09-08
- 自回归架构真能通向 AGI 吗?一位工程师的追问引发讨论 — mostly_deterministic · 2026-09-08