字节 SplitMoE:破解视觉 MoE 同质化陷阱,提升视频扩散模型扩展性
ByteDance · hf · 2026-09-30
字节提出 SplitMoE,解决视频扩散模型中 MoE 的“均匀性陷阱”:传统 token 级路由在同类专家池中独立路由,且均匀使用正则化让语义连贯的 patch 被打散到不同专家,导致路由碎片化与结构失真。
核心设计:
- 专家池一分为二:语义专家捕捉高层语义抽象,通用专家保留残差视觉信息与灵活生成能力
- 原型引导路由 + pull-push 正则,让 token 按语义自然聚类而非被强制均衡
结果显示,在等效激活参数预算下,SplitMoE 在收敛速度、路由连贯性与视频生成质量上均优于传统负载均衡 MoE,并揭示了涌现的粗到细去噪逻辑,为视频世界模型的扩展提供参考。
「多模态」频道最新
- 开发者直言超个性化音乐是伪命题:音乐本质是社交文化 — jordiponsdotme · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- 本地生图一年:从 Civitai 到 ComfyUI,体验为何都烂 — BenDLH · 2026-09-30
- 用 Opus 50 分钟做出 Violetto 1B 宣传片,几乎零媒体关注 — tensorqt · 2026-09-30
- 蒸馏视频模型频现伪影,作者长文剖析 LoRA 失配根源 — burkov · 2026-09-30
- 创作者基于 Marigold V2 攻克 AI 景深生成的时序闪烁难题 — AntonObukhov1 · 2026-09-30