3DZip:3D 问答任务的高效 token 压缩框架
Changwoo Baek · hf · 2026-08-04
当前的 3D 视觉语言模型(3D VLMs)通过将 2D 视觉特征投影到世界坐标来构建几何感知 token,但这会为每个场景生成数千个 token,带来巨大的计算和内存开销。
为了解决这一问题,研究者提出了 3DZip,一个三阶段的 token 压缩框架:
- 粗粒度体素化:去除点级别的冗余。
- 锚点选择:基于特征空间的多样性,通过行列式点过程(DPP)选择锚点 token。
- 空间约束合并:在空间约束下合并剩余 token,以保持几何连贯性。
在三个 3D 问答基准上的实验表明,3DZip 在仅保留 128 个 token 的情况下,依然能维持 94.7% 的原始性能,并将推理速度提升了 1.92 倍。
「研究」频道最新
- NeurIPS录用率受限内幕:场地不够,多推的论文只能拒 — qberthet · 2026-08-04
- 别让AI编码助手重复造轮子:RL环境应预装标准库 — cephaloform · 2026-08-04
- 深朴智能发布HiFi-UMI:无本体数据保真度大幅提升,后训练直达真机 — 机器之心 · 2026-08-04
- 千寻智能研究:机器人硬件升级后,老数据存在“开窍时刻” — 机器之心 · 2026-08-04
- QuerySplat: 解耦几何与外观的 3DGS 预测新框架 — zhenjun_zhao · 2026-08-04
- UniSim-SLAM: 统一 Sim(3) 优化的前馈 SLAM 系统 — zhenjun_zhao · 2026-08-04