斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速
GordonWetzstein · x · 2026-10-09
斯坦福团队联合 Google 提出 Level-of-Token(LoT)Diffusion,解决扩散模型对所有区域平均分配算力的问题。核心思路:把均匀 token 布局泛化为多分辨率布局——细节多的区域用细 token,其他区域用大块粗 token,通过 patch 级非对称 flow 参数化与多分辨率 embedding 适配预训练的 diffusion transformer,在每个去噪步保留全分辨率 flow 预测的同时只处理更短的 token 序列。
- 布局来源灵活:语义分割、边界框、纹理方差、景深线索,甚至 agent 生成的规划
- 无需重训即可继承预训练生成先验
- 图像与视频生成均呈现更优的质量-效率权衡,加速幅度由布局的 token 预算决定
「多模态」频道最新
- NeurIPS 2026 论文 NAMVIS:next-scale 自回归替代扩散,新视角合成提速 3 倍 — RexDouglass · 2026-10-09
- fal 工程师谈视频生成提速:H3 Max 五秒渲出 15 秒视频 — OdinLovis · 2026-10-09
- Odyssey 发布世界模型 Odyssey-3,Physics-IQ 刷出新 SOTA — Scobleizer · 2026-10-09
- 一个提示词生成完整电影:开发者公开多导演 Agent 流水线 — Exciting-Income-5840 · 2026-10-09
- Artificial Analysis:Nano Banana 2.1 成谷歌图像编辑最强模型 — ArtificialAnlys · 2026-10-09
- Nano Banana 2.1 九项能力全面进步,布局与人体的提升最大 — ArtificialAnlys · 2026-10-09