中科大团队提出 Hi-DiT:Latent-Pixel 双流扩散,ImageNet FID 降至 1.06
量子位 · wechat · 2026-09-26
中科大与智象 HiDream.ai 团队提出 Hybrid Latent-Pixel Diffusion Transformer(Hi-DiT),论文已被 ECCV 2026 接收。
核心方法
- 在共享 Transformer backbone 内同时协调 Latent stream 与 Pixel stream:早期高噪声阶段用 Latent stream 完成全局结构与语义规划,后期低噪声阶段通过时间门控(τ=0.3)打开 Pixel stream 补充高频纹理,缓解 Latent 路线细节丢失与 Pixel 路线优化困难之间的矛盾。
- 配套 High-Frequency Pixel Predictor:用卷积 + PixelShuffle 分层上采样预测局部 sub-patch,降低高维像素回归难度。
实验结果
- ImageNet 256×256:CFG 下 FID 1.06;ImageNet 512×512:gFID 1.26;MS-COCO 文生图语义对齐更紧。
- 消融显示:纯 Pixel stream FID 3.38,加 Latent 输入降至 1.74,加高频预测头达 1.65。
- 训练/推理开销仅小幅增加(单 epoch 17.7→18.1 分钟,单图 1.58→1.67 秒),峰值显存 35.52G。
代码与项目主页已开源:https://github.com/HiDream-ai/Hi-DiT
「多模态」频道最新
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- 6M tokens 成本 $65,Opus 5.5 端到端生成音乐视频已"不稀奇" — rickasaurus · 2026-09-27
- 一条 prompt 生成奇点主题视频essay,Runway CEO 演示全流程 — c_valenzuelab · 2026-09-27
- 8GB 显存 5060 本地跑 Qwen 图像生成,网友称效果惊人 — tryku2 · 2026-09-27
- 想拍软件质量讲解视频,结果全用 AI 做成了 MV — EricBuess · 2026-09-27
- 用 Opus 5.5 做 100 支视频后,开源 39 种风格的提示词库 — dotey · 2026-09-27