dRAE 将视觉离散化扩到 13.1 万 token,避免 codebook 崩塌
burny_tech · x · 2026-07-28
这篇论文提出了 dRAE:一种基于 超球面量化(Hyper-Spherical Quantization) 的离散表示自编码器,用角度路由替代传统欧式距离式 codebook 量化。
作者认为,传统方法容易出现 codebook collapse,根源是量化目标和视觉表示空间的几何结构不匹配;而 dRAE 把语义内容和特征幅度解耦,能更稳定地离散高维视觉表征。摘要称,该方法把词表规模扩展到 131,072 tokens,实现 100% codebook utilization,同时在重建、多模态理解和图像生成任务上都有提升。
「多模态」频道最新
- Netflix 的 ID-V2V 从单段视频保持身份并重风格化 — netflix · 2026-07-28
- 新论文给出原生多模态预训练的最优缩放规律 — burny_tech · 2026-07-28
- 新 ComfyUI 节点可把音频转成 MIDI — MuziqueComfyUI · 2026-07-28
- Boogu-Image-0.1 用 2.08 亿图像和 40 万美元冲到开源前列 — 机器之心 · 2026-07-28
- ComfyUI 基础概念探讨:为何工作流要拆分 Checkpoint 与 KSampler? — DavidThi303 · 2026-07-28
- RTX 4060 跑 Z Image Turbo 出图:如何突破画质上限? — Dangerous_Ring_435 · 2026-07-28