TWT 方法将 ViT 冗余层折叠为单层,算力近乎减半精度几乎不降
KyeGomezB · x · 2026-09-26
挪威研究团队(Oslo 大学医院/奥斯陆大学等)提出 Transformer-Within-Transformer(TWT),一种事后(post-hoc)模型压缩方法。
- 核心发现:Vision Transformer 深层常进入局部相似的"计算阶段",相邻一组层的输出变化很小,存在深度方向的计算冗余。
- 做法:将连续的冗余层组融合为一个学习得到的代理注意力层,直接从阶段起点映射到终点,保留 token 混合能力,同时砍掉多余深度。
- 效果:在 DINOv2 上推理算力(FLOPs)约减半、精度仅有微小下降;在 ImageNet-1k 上,六层 TWT DINOv2 B/14 达 84.2% top-1,算力 11.71 GFLOPs(对比 Raptor 的 84.0%、23.42 GFLOPs);在多个病理组织学下游任务上甚至持平或超过原基线。
「模型」频道最新
- 被指 Opus 5.5 遭暗改降智,NerfBench 将发布首日与复测对比 — CurieuxExplorer · 2026-09-26
- METR 评测代号被破解:PHASEONE 训练用 64 小时跑 agent 任务 — basedjensen · 2026-09-26
- 爆料称 Anthropic 蒸馏管线增强,Sonnet 升级或有大跳跃 — zephyr_z9 · 2026-09-26
- 用户感叹 Opus 5.5 说话方式「吓人」:里面像真有个活人 — akbirthko · 2026-09-26
- Sebastian Raschka 推理系列第五讲:对数概率打分与自我修正 — rasbt · 2026-09-26
- 曝 OpenAI 常驻 agent 命名「o」,Pro 全档可用含 Fast Mode — Expert_Annual_19 · 2026-09-26