新研究:扩散模型中间的 contextual tokens 已「读出」未成形图像内容
kwangmoo_yi · x · 2026-10-07
特拉维夫大学与康奈尔团队的论文《Learning to Read the Contextual Tokens in Diffusion Transformers》提出一个框架,通过自然语言问答直接「审问」MM-DiT 中的 contextual tokens:
- 发现:MM-DiT 中随去噪过程被多模态注意力持续更新的文本 tokens,其实已吸收大量关于正在生成的图像的语义信息——在图像还很模糊、几乎无法辨认的早期去噪阶段,就已能回答「这个人在做什么」这类问题。
- 方法:训练一个轻量瓶颈网络,把中间 contextual tokens 映射到冻结 LLM 的输入空间,让 LLM 直接从中回答关于图像的问题,从而揭示这一空间的语义内容。
- 应用:用读出的语义信息反过来监督 contextual tokens,可提升生成质量与分布覆盖。
代码即将开源。
所属事件:新研究发现扩散 Transformer 早期已可读出图像内容(2 条相关)→
「多模态」频道最新
- 开源土耳其语 TTS 模型 ema-lightning 冲上 Hugging Face 热榜 — canberkkkkkk · 2026-10-07
- 作者用 Runway 最新工具复刻汽车广告,拍出 Speedhunter — Uncanny_Harry · 2026-10-07
- Gradium-TTS 登顶语音延迟榜:首音频仅 68 毫秒 — mattturck · 2026-10-07
- Nano Banana 2.1 对阵 GPT 图像 2.5:照片细节上 GPT 略胜 — techhalla · 2026-10-07
- 文字与静物轮:两款模型都不再翻车文字,GPT 美感略胜 — techhalla · 2026-10-07
- Seedance 2.0 试玩:教堂另一面,OpenArt 用户晒AI视频生成效果 — piotrbinkowski · 2026-10-07