V-CoLA:免训练压缩视觉 token 一半,性能保留 99.5%、预fill 提速 6 倍
ATH-MaaS · hf · 2026-10-09
ATH-MaaS 发布 V-CoLA,一个专为线性注意力混合架构(如 Qwen3.5)设计的免训练视觉 token 压缩框架。
要点:
- 动机:VLM 中视觉 token 主导输入序列,计算开销大;现有面向 softmax 注意力的压缩方法在引入线性注意力的混合架构上性能明显退化。
- 方法:提出 uniqueness-aware 的重要性判据筛选关键视觉 token,配合自适应 token 合并策略执行压缩;所有组件在实现层适配线性注意力的 chunk-wise 并行。
- 效果:仅保留 50% 视觉 token 时性能达原模型 99.5%,压到 12.5% 仍保留 88% 以上,prefill 加速 1.86 至 6.15 倍。
「模型」频道最新
- Chollet:远迁移在人类身上无证据,LRM 可能同样如此 — burny_tech · 2026-10-09
- Google AI Overviews 搜梗图自我误导,用户吐槽又翻车 — prajdabre · 2026-10-09
- InfiLoop:循环注意力残差让7M小模型跑2万步推理,数独97.9% — Pengxiang Li · 2026-10-09
- ChatGPT 200 美元套餐额度降至 10x,但每周免费重置相当于双倍 — vuonghtt · 2026-10-09
- Grokipedia 实时编辑页上线,可围观 AI 百科 119 万条修改变更 — XFreeze · 2026-10-09
- 玩家与 Grok 玩词联想游戏,追问后其承认「不存数据」是预设回答 — jetopia · 2026-10-09