UCLA 借 MoE 路由输出做跨语言对齐,提升多语言性能

UCLA · hf · 2026-10-07

UCLA 提出针对 decoder-only LLM 的跨语言对比学习新方法:由于多语言 tokenization 不一致,无法像多语言 encoder 那样在 hidden states 上直接施加对齐损失。团队改用 MoE router 输出作为对齐目标——router 输出更适合跨多 token 池化,可在序列级做更可靠的跨语言比较。在 4 个开源 MoE 上的持续预训练实验显示,该 routing loss 同时对齐了底层 hidden 表征,并在多样化评测套件上提升多语言性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →