DiT 研究发现模板 token 充当语义寄存器并可剪 20% FLOPs
RTP-LLM · hf · 2026-07-22
扩散 Transformer 里,模板 token 其实在当“语义寄存器”
这篇研究用一个因果可解释框架分析文生图扩散 Transformer(DiT)在去噪过程中的内部计算,方法上结合了注意力分解和跨 token span、head、layer 的定向干预。
- 作者把 token 分成 prompt 内容 token 和 结构模板 token 两类,发现模板 token 在编码器输出阶段几乎不携带 prompt 专属信息。
- 但它们随后会变成最重要的 image-to-text 注意力汇聚点,并在因果上维持 DiT 内部的对象身份,像一个隐式的 语义寄存器。
- 论文认为,语义并不是从 prompt token 直接传给模板 token,而是先注入到图像 latent,再被模板 token 读回去。
- 基于这一观察,作者提出了一个 无需训练的剪枝规则:那些最强烈关注 prompt token 的 heads 其实是可裁剪的。
- 剪掉这些 heads 后,可减少 20% attention FLOPs,而 GenEval 只下降 1.4 分。
- 论文还进一步刻画了不同层和不同 head 的分工:把语义路由和视觉合成分开,并描述了从身份形成、传播到细化的计算流程。
「多模态」频道最新
- Dreamina Seedance 2.0 被测试为 AI 视频的大升级 — Med1_Ai · 2026-07-22
- 用 depth map 分镜后,Seedance 2.0 的镜头稳定多了 — RealJamesOfficial · 2026-07-22
- Midjourney 创作者发布 4 个身份主题像素词 — LudovicCreator · 2026-07-22
- 马斯克转发 Grok Imagine 像素风仙女提示词 — elonmusk · 2026-07-22
- Qwen 图像编辑节点主打保分辨率和省显存 — Fine-Run992 · 2026-07-22
- Krea 2 Identity Edit 放出新样例和提示词 — Fishmongr · 2026-07-22