14 步手推 Sora 的 DiT:提示词与时步只靠缩放和平移注入

ProfTomYeh · x · 2026-09-16

ProfTomYeh 用 14 个手工步骤拆解 Sora 背后的 Diffusion Transformer (DiT)。核心结论:DiT 就是一个预测噪声的 transformer——视频以潜空间 patch 进入、从不接触像素;提示词和扩散时步唯一的作用点是通过自适应 LayerNorm 生成 scale 和 shift 两个算术操作,而不是一个独立模型。

流程要点:

作者强调:第 4、11 步是训练,12–14 是生成,其余是可堆叠几十层的模块。DiT 思想延续至今成为视频生成模型的基础。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →