14 步手推 Sora 的 DiT:提示词与时步只靠缩放和平移注入
ProfTomYeh · x · 2026-09-16
ProfTomYeh 用 14 个手工步骤拆解 Sora 背后的 Diffusion Transformer (DiT)。核心结论:DiT 就是一个预测噪声的 transformer——视频以潜空间 patch 进入、从不接触像素;提示词和扩散时步唯一的作用点是通过自适应 LayerNorm 生成 scale 和 shift 两个算术操作,而不是一个独立模型。
流程要点:
- 视频切成跨时空的 patch,视觉编码到潜向量(论文中 196,608 维→4,096 维)
- 按时步 t 加噪;提示词与时步编码拼接后估出 scale/shift 施加到被噪潜向量上
- 自注意力让 patch 在时空上混合,保持帧间一致性;FFN 输出预测噪声
- MSE 损失对可学习参数反向传播(编码器/解码器冻结);去噪、解码、重排 patch 即生成过程
作者强调:第 4、11 步是训练,12–14 是生成,其余是可堆叠几十层的模块。DiT 思想延续至今成为视频生成模型的基础。
「多模态」频道最新
- Cartesia 谈 TTS 评测之难:单一分数无法概括语音质量 — saranormous · 2026-09-16
- RX 9070 跑音乐模型 YuE2 仅约 7 token/s,VRAM 大量闲置引困惑 — Prestigious-Kick7291 · 2026-09-16
- Pixio 推出 AE 插件:AI Agent 直接在时间线里搭图层与关键帧 — tsi_org · 2026-09-16
- Midjourney + Gemini 组合技:风格参考转写实照片 — michaelrabone · 2026-09-16
- Seedance 2.5 复刻 GTA 式潜行关卡:手机追踪全程不穿帮 — SimplyAnnisa · 2026-09-16
- 用 Nex-N2.5 Pro 造出可交互 3D 机械花园,改 N 轮才成型 — nikola_mr64990 · 2026-09-16