UCLA 借 MoE 路由输出做跨语言对齐,提升多语言性能
UCLA · hf · 2026-10-07
UCLA 提出针对 decoder-only LLM 的跨语言对比学习新方法:由于多语言 tokenization 不一致,无法像多语言 encoder 那样在 hidden states 上直接施加对齐损失。团队改用 MoE router 输出作为对齐目标——router 输出更适合跨多 token 池化,可在序列级做更可靠的跨语言比较。在 4 个开源 MoE 上的持续预训练实验显示,该 routing loss 同时对齐了底层 hidden 表征,并在多样化评测套件上提升多语言性能。
「研究」频道最新
- OpenAI 问题 #109 再收紧:κ 改进约 5.7 亿倍,逼近理论上限 — aran_nayebi · 2026-10-07
- Datology 开源 Zephon:确定性流式 dataloader 解决 GPU 数量不一致难题 — josh_wills · 2026-10-07
- NVIDIA 论文 VERA:让 Agent 框架与模型共同进化,9B 版超出基线 10 分 — omarsar0 · 2026-10-07
- Isomorphic Labs 成 Virtual Biology Initiative 创始成员,开放生物数据 — proteinrosh · 2026-10-07
- MIT 把编码 agent 丢上无人岛 30 小时,研究机器「玩耍」 — phillip_isola · 2026-10-07
- GPT-7「证明」乘法提速 0.0000000000163%,数学家笑了 — jxmnop · 2026-10-07