论文:扩散 Transformer 生成早期即可读出大量图像信息

kwangmoo_yi · x · 2026-10-07

Dahary 与 Sella 等人的论文《Learning to Read the Contextual Tokens in Diffusion Transformers》发现,在生成图像尚未达到勉强可辨识的程度之前,模型内部的 contextual tokens 已经编码了大量关于最终图像的信息,可以直接读出。这一发现为理解扩散模型内部表征和早期干预生成过程提供了新视角。

所属事件:新研究发现扩散 Transformer 早期已可读出图像内容(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →