北大提出视觉语言MoE负载均衡新方法ReBA

PekingUniversity · hf · 2026-08-04

在视觉语言混合专家模型中,由于图像和文本的 token 数量极不均衡,传统的辅助损失函数在混合负载下容易掩盖真实的模态负载误差。北京大学研究团队发现,同一个训练好的路由网络在不同图像分辨率下,负载不平衡度的变化可超过五倍。

为此,团队提出了 ReBA (Relax Within, Balance Across) 方法。该方法基于对路由输入几何结构的观察:图像和文本占据不同区域,且视觉 token 按来源图像成组分布。ReBA 针对模态边界和图像边界分别设计了独立的均衡策略:

实验表明,在四个拆分的骨干网络上,ReBA 不仅维持了与标准方法相当的任务准确率,还显著降低了各种测试输入下的负载不平衡,并在分辨率和分块变化时展现出更强的鲁棒性。代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →