新研究:扩散模型中间的 contextual tokens 已「读出」未成形图像内容

kwangmoo_yi · x · 2026-10-07

特拉维夫大学与康奈尔团队的论文《Learning to Read the Contextual Tokens in Diffusion Transformers》提出一个框架,通过自然语言问答直接「审问」MM-DiT 中的 contextual tokens:

代码即将开源。

所属事件:新研究发现扩散 Transformer 早期已可读出图像内容(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →