三星提出 reViT:单个 Transformer 块循环复用,省 70% 参数追平 DeiT III
SamsungResearch · hf · 2026-10-09
三星研究院(SamsungResearch)发布视觉 Transformer 新架构 reViT,核心思路是让单个 Transformer 块循环应用,通过深度编程的专家混合(FFN 的凸组合)恢复各循环深度的差异,在相近推理 FLOPs 下匹配全深度视觉编码器的精度。
关键结果:
- reViT-B/16 从零训练即可达到 DeiT III 精度,存储参数减少约 70%
- 对比实验显示,在单 FFN 预算下,权重空间合并(weight-space merging)是测试过的最强 MoE 方案,优于 token 分发和输出混合
- 仅用 DINOv2 教师输出特征蒸馏的 8 专家模型,几乎保留教师全部线性探测精度,并能迁移到分类、分割、深度估计
- 弹性深度训练:一个 checkpoint 通过重采样归一化深度坐标即可在多个深度运行;固定深度部署时可物化为常规稠密图,免去在线路由开销
「研究」频道最新
- EMNLP 论文提出 Claim-Locked Reporting,锁死数字与断言的对应关系 — jiqizhixin · 2026-10-09
- OpenAI 发布 372 项数学证明,含 23 个 Erdős 问题 — burny_tech · 2026-10-09
- NVIDIA NeMo-DCR 将 1T 模型 RL 权重同步从 87.5 分钟压到 150 秒 — IanAndrewsDC · 2026-10-09
- Dex-One2Many:一条人类视频训练灵巧手零样本迁移真实机器人 — furongh · 2026-10-09
- GenIA:免重训对齐 SAM3D,单图到高保真 3D 重建 SOTA — JonathonLuiten · 2026-10-09
- TIER IV 开源 METEOR:54M 参数单模型跑 12 项自动驾驶任务 — rsasaki0109 · 2026-10-09