MiniT2I 用区域 token 砍半像素扩散计算量,速度翻倍质量不变
AntonObukhov1 · x · 2026-09-12
像素扩散模型对每个 patch 都要按完整 token 处理,导致空白天空和人脸消耗一样多的算力。研究团队微调出 MiniT2I,改用区域 token(region tokens)而非全量 patch token。
- 效果:token 数量减半,生成质量不变,推理速度翻倍。
- 灵活性:在不同算力预算下训练,支持弹性推理(elastic inference),可按需调整计算量。
这一思路针对像素级扩散「每 patch 都是每层 token」的算力浪费问题,是 diffusion 架构效率方向的新方法。
「多模态」频道最新
- 用 Eleven Music 生成 90 年代电视购物风广告配乐的完整提示词 — charis_ai · 2026-09-12
- Nari Labs 发布 40ms 语音转文字,价格仅 Gemini 的九分之一 — alexcovo_eth · 2026-09-12
- 晒一个科幻极简风文生图提示词模板,灰红配色 Apple 质感 — aziz4ai · 2026-09-12
- NVIDIA 发布 TensorRT Model Connect,加速视频转语音构建 — NVIDIAAI · 2026-09-12
- 波普艺术爆炸风提示词:Ben-Day 圆点打造冲击力画面 — LudovicCreator · 2026-09-12
- HeyGen 拆解 16 秒无后期 AI 视频:首尾双帧定死,模型只补中间 — HeyGen · 2026-09-12