斯坦福提出 Level-of-Token DiT:让预训练扩散模型支持任意尺寸 token 网格
GordonWetzstein · x · 2026-10-07
研究者提出 Level-of-Token DiT,对预训练 DiT 做最小改动即可支持非均匀 token 布局:
- 核心思路是把预训练 DiT 的均匀 token 网格泛化为「Level-of-Token」布局,每个 token 是任意尺寸的矩形,共同平铺整张图像。
- 每个 token 由其覆盖的 latent patch 投影得到,DiT 以 token 形状为条件,再由依赖范围的 head 恢复非对称速度场,并转换为满秩速度。
- 用 patch-wise 非对称 flow matching 对图像模型(Flux.2)和视频模型(Wan2.1)做微调,从而保留预训练的生成先验。
所属事件:斯坦福提出 LoT 扩散模型,按需分配 token 最高提速 4.6 倍(4 条相关)→
「多模态」频道最新
- 语音 Agent 的关键在「听起来对」:Turbo 会随用户情绪切换语气 — SucceededMind · 2026-10-07
- Magnific 原创剧集《The Chronicles of Bone》第六集上线,全程 AI 制作 — Kavanthekid · 2026-10-07
- Hedra 上架 ChatGPT 插件:传一张产品图即可生成完整商业广告 — henloitsjoyce · 2026-10-07
- Marc Andreessen 加码:AI 电影大赛 SLOPTOBERFEST 大奖升至2.5万美元 — zealcaiden · 2026-10-07
- 新图像模型定价曝光:2K 每张 0.05 美元,4K 每张 0.076 美元 — op7418 · 2026-10-07
- Flow-GRPO 接入真人投票打分,防图像模型钻奖励模型空子 — lmoroney · 2026-10-07