四叉树视觉分词器 QuadTok:省 10% token,ImageNet 达 2.08 gFID
Yucheng Mao · hf · 2026-10-08
提出 QuadTok,一种用于自回归图像生成的层次化四叉树视觉分词器,在 2D 网格的空间绑定与 1D 序列的灵活性之间架起桥梁。
要点:
- 分词器按视觉复杂度动态分配表示容量:精细区域细分、同质区域保持粗分辨率。
- 相比固定 256 token 网格,ImageNet 上节省约 10% token,零样本迁移到 COCO 省 9%,重建保真度相当。
- 树结构天然引入因果性,支持自回归生成:给定四叉树拓扑条件,947M 的 GPT 式模型在 ImageNet 256×256 上取得 2.08 gFID。
- 利用四叉树保留的空间相关性,可实现零样本空间受控生成。
代码已开源。
「多模态」频道最新
- VELA 1.0 发布:非破坏性优化 MiniMax H3 视频,0.8MP 生成从 2:53 缩至 2:13 — NoMouse9610 · 2026-10-08
- InSpatio-World 1.5 开源:单图/视频输入生成可导航 4D 世界 — liuziwei7 · 2026-10-08
- Opus 5.5 用 MCP 驱动 Blender+Suno,3.5 小时无人工做出音画同步神作 — sidahuj · 2026-10-08
- LLM 写 Blender 代码碾压视频模型:最短将杀对局实测 — jyangballin · 2026-10-08
- KAIST LipForcing 实测翻车:面部大幅移动时牙齿糊成白色一块 — Neat_Lab_4435 · 2026-10-08
- 训练100+个Krea 2角色LoRA后:数据质量比数量更决定相似度 — Cold-Worldliness5392 · 2026-10-08