斯坦福提出 LoT 扩散:按重要性分配 token,视频生成快 4.6 倍
GordonWetzstein · x · 2026-10-07
Level-of-Token (LoT) Diffusion 的核心观察是:扩散模型对空白墙面和人脸花费相同算力,而生成前往往已知细节会出现在哪里。
- 核心思路:把预训练 DiT 的均匀 token 网格推广为多分辨率 token 布局——每个 token 是任意大小的矩形,共同铺满整张图;细节处用细 token,其余用粗 token。
- 实现:对预训练 DiT 做最小改动,token 从其覆盖的 latent patch 投影而来,DiT 以 token 形状为条件,用 extent-dependent heads 恢复非对称速度并转换回满秩速度。在图像模型 Flux.2 和视频模型 Wan2.1 上用 patch 级非对称 flow matching 微调,保留预训练生成先验。
- 布局来源:包围框、语义掩码、纹理方差、深度图均可作为布局信号,同一模型适配任意来源;视频场景可逐帧布局跟随运动,token 减少 1.3–2.1 倍。
- 效果:一张图用 6,632 个 token 替代 14,336 个,生成快 2.5 倍,细节集中时最高快 4.6 倍;还支持智能体直接在画布上画重要性图(token 少 2.6 倍),或在 Blender 中搭粗略 3D 场景规划视频细节分布(token 少 1.5 倍)。
所属事件:斯坦福提出 LoT 扩散模型,按需分配 token 最高提速 4.6 倍(4 条相关)→
「多模态」频道最新
- 手机实时操控 3D 场景:音频驱动程序化装置 demo 迭代 — DimitriDeJonghe · 2026-10-07
- 开发者用 HeyGen Video 1 做互动叙事 App:用户日均停留超 60 分钟 — HeyGen · 2026-10-07
- Jordi Pons 推出 AI 互动音乐游戏「一只鸡死了」 — jordiponsdotme · 2026-10-07
- LichtFeld 稠密化插件大提速:85.5 秒降至 16.7 秒 — janusch_patas · 2026-10-07
- Nano Banana 2.1 发布:画质提升修 bug,价格更低 — OfficialLoganK · 2026-10-07
- OmniReasoning:音视频联合推理基准,较 Qwen3-Omni 提升 12.8 点 — _akhaliq · 2026-10-07