UIUC×谷歌推出BudgetPix:单模型按图像复杂度自适应算力,token可降至10%
CSProfKGD · x · 2026-10-10
UIUC 与 Google 研究者发布 BudgetPix,一个像素空间图像扩散的自适应 tokenization 框架。传统图像生成对等大小 patch 分配相同算力,平坦背景与精细细节一视同仁,BudgetPix 通过三个组件改变这一点:熵引导四叉树的自适应编码器把固定图像映射为可变长度 token 序列、多尺度感知解码器、以及支持可变 token 数的训练与采样方案。同一 prompt、同一噪声下,推理时 token 用量可从 100% 连续降到 10%,单一 checkpoint 即可覆盖很宽的算力预算。评测显示其匹配 MiniT2I-L(512²,GenEval 0.874 vs 0.882)和 PixelDiT(1024²,0.725 vs 0.721)的质量,兼容 JiT、MiniT2I、PixelDiT 三种像素空间扩散架构。论文已挂 arXiv,代码即将开源。
「多模态」频道最新
- 一个提示词让 Opus 把 OpenAI 722 篇数学论文变成 92 秒动画 — FinanceYF5 · 2026-10-10
- 网友用 AI 还原 ChatGPT 登上 Win98/XP/Vista/7 的样子 — Midnight_Sun_BR · 2026-10-10
- MiniMax H3 在 ComfyUI 中实现视频一键去人 — RobbaW · 2026-10-10
- 免费女性面部提示词构建器更新:AI 解析自然语言转 SD 提示词 — dobelmont · 2026-10-10
- 从业者:逐模型定制可避免模型与 2D 动画风格打架 — andrew_n_carr · 2026-10-10
- Reddit 网友整理 ComfyUI/MiniMax 新手速查表,号称减 83% 废图 — Nimblecloud13 · 2026-10-10