UIUC×谷歌推出BudgetPix:单模型按图像复杂度自适应算力,token可降至10%

CSProfKGD · x · 2026-10-10

UIUC 与 Google 研究者发布 BudgetPix,一个像素空间图像扩散的自适应 tokenization 框架。传统图像生成对等大小 patch 分配相同算力,平坦背景与精细细节一视同仁,BudgetPix 通过三个组件改变这一点:熵引导四叉树的自适应编码器把固定图像映射为可变长度 token 序列、多尺度感知解码器、以及支持可变 token 数的训练与采样方案。同一 prompt、同一噪声下,推理时 token 用量可从 100% 连续降到 10%,单一 checkpoint 即可覆盖很宽的算力预算。评测显示其匹配 MiniT2I-L(512²,GenEval 0.874 vs 0.882)和 PixelDiT(1024²,0.725 vs 0.721)的质量,兼容 JiT、MiniT2I、PixelDiT 三种像素空间扩散架构。论文已挂 arXiv,代码即将开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →