论文:扩散 Transformer 生成早期即可读出大量图像信息
kwangmoo_yi · x · 2026-10-07
Dahary 与 Sella 等人的论文《Learning to Read the Contextual Tokens in Diffusion Transformers》发现,在生成图像尚未达到勉强可辨识的程度之前,模型内部的 contextual tokens 已经编码了大量关于最终图像的信息,可以直接读出。这一发现为理解扩散模型内部表征和早期干预生成过程提供了新视角。
所属事件:新研究发现扩散 Transformer 早期已可读出图像内容(2 条相关)→
「多模态」频道最新
- LichtFeld Studio 3D 重建背包,效果惊艳 — janusch_patas · 2026-10-07
- OmniVoice 微调效果惊艳:600 语言+低显存语音克隆 — CeFurkan · 2026-10-07
- 免费开源 LoRA 训练器扩至 10 个模型家族,新增 ERNIE-Image 与云端部署 — AcademiaSD · 2026-10-07
- 收录 226 个 Claude Opus 动画视频案例,Prompt 全部公开可跑 — dotey · 2026-10-07
- Nano Banana 2.1 上线 Magnific,支持 4K 生成与更强提示词遵循 — aziz4ai · 2026-10-07
- 2000+ Star 开源项目新增 9 种 AI 动画讲解视频风格,附完整起号工作流 — dotey · 2026-10-07