北大提出视觉语言MoE负载均衡新方法ReBA
PekingUniversity · hf · 2026-08-04
在视觉语言混合专家模型中,由于图像和文本的 token 数量极不均衡,传统的辅助损失函数在混合负载下容易掩盖真实的模态负载误差。北京大学研究团队发现,同一个训练好的路由网络在不同图像分辨率下,负载不平衡度的变化可超过五倍。
为此,团队提出了 ReBA (Relax Within, Balance Across) 方法。该方法基于对路由输入几何结构的观察:图像和文本占据不同区域,且视觉 token 按来源图像成组分布。ReBA 针对模态边界和图像边界分别设计了独立的均衡策略:
- 对图像和文本采用独立的均衡项。
- 为每张图像分配等权重的路由实例。
实验表明,在四个拆分的骨干网络上,ReBA 不仅维持了与标准方法相当的任务准确率,还显著降低了各种测试输入下的负载不平衡,并在分辨率和分块变化时展现出更强的鲁棒性。代码已开源。
「研究」频道最新
- LeRobot社区已支持30多种机器人硬件,即插即用 — m_wulfmeier · 2026-08-04
- 吐槽学术圈审稿:NeurIPS 的本质是疯狂滚动 OpenReview — abursuc · 2026-08-04
- 开源卫星图像编辑 LoRA:用基础模型自动造训练数据 — LimitlessSaint · 2026-08-04
- 周末项目:用RL训练4B模型改写AI文本,成功骗过开源检测器 — matthen2 · 2026-08-04
- 新加坡国立大学打造双电机仿生章鱼机器人 — lukas_m_ziegler · 2026-08-04
- 原生工具调用与采样参数修正,可大幅提升模型评测分数 — xeophon · 2026-08-04