Braco 视觉 token 压缩144倍仍保95.2%精度,端到端提速约36%
Rui Zhong · hf · 2026-09-30
论文从「token 参数化」视角重新审视视觉-语言模型的极端视觉 token 压缩:把基变换与结构化截断(决定可压缩性)与坐标组织(决定可学习性与跨模态对齐)分开分析。
- 由此导出可压缩性与可学习性两个耦合目标,并形式化为统一泛函
- 设计出 Braco:一个轻量四步编码器,结合变换基截断、与输入无关的基-坐标嵌入、随预算变化的正交重参数化、以及轻量池化得到的残差空间 token
- 在 23–64 倍压缩下形成最优精度-效率前沿,144 倍压缩仍达 95.2% 精度,prefill FLOPs 较未压缩上限降低 84.2%–86.7%
- 相比此前方法,精度持平或更优,同时端到端最高提速约 36%,压缩器延迟/FLOPs 降低 16.6 倍/78.8 倍
「研究」频道最新
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- François Fleuret:AI 数学将让人类数学彻底边缘化 — francoisfleuret · 2026-09-30
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- UMass 教授 Luc Rey-Bellet 三套随机过程讲义公开,覆盖 MCMC 基础 — michaelchchoi · 2026-09-30
- VoxMem 基准:15 个音频大模型记忆能力无一超过 40% — unimelb-hf · 2026-09-30
- EpiCon:多智能体共享多模态记忆库,11 项基准平均提升 1.7-4.9 分 — Ziyun Zeng · 2026-09-30