MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar
ECCV 2026
cs.CV
2026-08-18
Meta 的 MoE-ViE 把 CLIP 视觉塔换成细专家+共享专家+定制 Triton 核,全尺度胜稠密,最大模型 1.1B 激活参数追平 1.9B 稠密编码器。
视觉语言模型的视觉塔靠堆容量涨点,但稠密堆法推理延迟和计算成本线性涨,高分辨率图像和长视频里这笔账更疼。MoE 在 LLM 侧已经是成熟方案,容量和计算解耦,可搬到 CLIP 式视觉编码器上一直没做出 SOTA:此前的尝试(LIMoE、CLIP-MoE、CLIP-UP 等)都没追上最好的稠密模型。Meta 团队这篇要回答的是:MoE 用对了拓扑,视觉编码器能不能既省又强。
四个设计决定撑起整篇。
细粒度专家。常规做法把稠密 MLP 换成 N 个等宽专家,收益有限。这里每个专家宽度压到原 MLP 的 1/4,总数维持 32 个,同等计算预算下专家更小更多。消融显示专家宽度从粗到细一路涨点,到 1/4 宽以下才饱和。视觉特征天然异质(颜色、形状、空间布局各有分工),小专家的分工粒度对得上。
共享专家。保留 1 个始终激活的专家承载全局上下文,路由专家做条件化变换。数量消融显示 1 个就够,再多不再涨。
Sigmoid 路由加无辅助损失均衡。门控用 Sigmoid 替代 Softmax 避免专家间竞争;均衡不用辅助损失,在路由偏置上做更新,标准做法按过载符号加减常数,这里改成按 z-score 缩放,失衡越重修正越大,接近均衡时不会震荡。对比实验里两种 loss-free 变体全面优于 importance/load 损失和熵损失。
定制 Triton 核。MoE 的理论省算常被实现吃掉:逐专家小 GEMM、动态路由的 CPU-GPU 同步、HBM 往返都是瓶颈。Grouped GEMM 把所有专家的矩阵乘合成一次 GPU 任务,核融合把投影和激活并在一趟。batch 16 时延迟从 318.76ms 降到 82.59ms,约 3.9 倍加速。
视频阶段的防遗忘也有讲究。先在 3.5B 图文对上做对比预训练,再用视频数据微调。直接微调会明显掉图像能力,混入图像数据只能部分挽回还压制视频涨点。他们的做法是帧级蒸馏(冻结的图像预训练模型当老师,随机抽一帧算余弦距离损失)加冻结 MoE 专家和文本塔 MLP 层,理由是逐帧编码器的视觉词表不需要大改,要改的是帧特征怎么聚合。两者组合在图像和视频基准上同时最优。
零样本图像基准,每个尺度都赢稠密对照。B/32 上平均分类从 55.8 涨到 63.2;L/16 上从 78.0 涨到 79.6。最大模型 MoE-ViE-H/14(3.5B 总参,1.1B 激活)对比 1.9B 全激活的 PEcore G/14:ImageNet-A 反超 0.6 点(93.2 对 92.6),细粒度分类平均 83.9 对 83.8,OCR 平均 80.2 对 78.8,ImageNet 88.3 对 88.6 略低。
对齐 LLM 后差距更明显。接 Llama 3.1 Instruct 8B,MoE-ViE-H 平均图像分 75.2,对比对象里最高的 AIMv2 3B(2.7B 激活)是 69.8;平均视频分 55.0,对手全部在 47.6 以下。1.1B 激活参数超过了 5.5B 激活的 InternViT2.5。
延迟是卖点:MoE-ViE-H 在 576 token 输入下跑到 PEcore G 的约 76% 延迟,准确率相当。
专家确实在分工。第 20 层的可视化里,11 号专家集中响应狗耳,18 号响应眼鼻,29 号稳定响应背景;路由熵随深度递减(花类基准从 L0-5 的 3.20 降到 L26-30 的 2.30),越深的层越专。
这条路线把「MoE 只在 NLP 灵」的旧印象翻掉了:视觉编码器同样能靠稀疏激活白拿容量。对做 VLM 的团队,1.1B 激活参数的视觉塔打平 1.9B 稠密,意味着端侧和低成本场景的视觉编码器有了新档位。Triton 核是通用件,可直接替换其他 MoE 拓扑。细粒度加共享专家的配方也和 DeepSeekMoE 等 LLM 侧结论互相印证,属于跨模态可迁移的设计经验。
渐进改良要说实话:相对最好的稠密模型,绝对提升不大(多数基准 1 点上下),论文的分量更多在「全尺度一致 + 激活参数省 42% + 延迟省 24%」这个组合上。
作者层面:正文没有独立的局限小节,只讨论了朴素 MoE 实现的工程缺陷。对比锚定在 Meta 自家的 PEcore 系列与 SigLIP2,这两个基线在部分基准上本来就不互有胜负,横向图景依赖自家训练管线的公平性;预训练数据里 1.5B 图文对是专有的,复现验证只能靠放出的代码和权重。微调后视频检索平均分(49.5)低于 PEcore G(49.9)和自家 L 档趋势,视频侧增益集中在分类。激活 1/8 专家的 B/L 档与 1/4 的 H 档设置不同,跨档对比要小心。工程上 MoE 训练与部署复杂度高于稠密,论文没有给出训练成本对比。