斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速

GordonWetzstein · x · 2026-10-09

斯坦福团队联合 Google 提出 Level-of-Token(LoT)Diffusion,解决扩散模型对所有区域平均分配算力的问题。核心思路:把均匀 token 布局泛化为多分辨率布局——细节多的区域用细 token,其他区域用大块粗 token,通过 patch 级非对称 flow 参数化与多分辨率 embedding 适配预训练的 diffusion transformer,在每个去噪步保留全分辨率 flow 预测的同时只处理更短的 token 序列。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →