3DZip:3D 问答任务的高效 token 压缩框架

Changwoo Baek · hf · 2026-08-04

当前的 3D 视觉语言模型(3D VLMs)通过将 2D 视觉特征投影到世界坐标来构建几何感知 token,但这会为每个场景生成数千个 token,带来巨大的计算和内存开销。

为了解决这一问题,研究者提出了 3DZip,一个三阶段的 token 压缩框架:

在三个 3D 问答基准上的实验表明,3DZip 在仅保留 128 个 token 的情况下,依然能维持 94.7% 的原始性能,并将推理速度提升了 1.92 倍。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →