TBSM新方法实现单步图像生成,20B文生图模型推理加速
机器之心 · wechat · 2026-08-10
西湖大学与浙江大学联合培养博士生孙鹏提出新框架 TBSM(Three-Body Scattering),旨在将现有的扩散或流匹配模型高效转化为单步生成器(NFE=1)。
核心机制
- 三体散射:不依赖固定的在线教师模型,而是通过“一个真实样本+两个生成样本”构建局部的 Fake-to-Real 转移方向。
- 轻量级 Tracker:在线训练一个不到 30M 参数的轻量网络来学习上述散射方向的稳定均值,引导约 800M 参数的生成器回归目标位置。训练完成后 Tracker 即可移除。
- 无需对抗训练:使用普通回归更新,避开了 GAN 极敏感的极小极大优化,也无需传统蒸馏中的噪声-时间监督。
实验数据
- 在 ImageNet-256 上,潜空间和像素空间单步生成的 FID 分别达到 1.63 和 2.23。
- 将不适配单步生成的 DiT-XL/4 模型经 TBSM 训练后,FID 从 398.20 暴降至 1.92。
- 成功应用于 20B 参数的文生图模型(从 Qwen-Image 初始化),在无 CFG 的情况下实现高质量一步生成。
项目已开源 MNIST 与 ImageNet-1K 训练代码,后续计划发布 20B 文生图模型权重。
「多模态」频道最新
- MiniMax-H3 低显存优化方案:省下 10GB+ 显存告别爆内存 — Annual_Mess_1839 · 2026-08-10
- 马斯克转发实测:Grok 视频生成展现完美角色一致性 — elonmusk · 2026-08-10
- 烧 300 美元用 AI 制作真实游戏预告片 — KaLoiCus · 2026-08-10
- 曝 xAI 升级图像生成模型 Grok Imagine 2.0 — nima_owji · 2026-08-10
- Wan Animate 2 与 SCAIL-2 视频生成模型能力讨论 — Xxtrxx137 · 2026-08-10
- 展示视频模型 MH3 生成片段 — Z3ROCOOL22 · 2026-08-10