UCLA 首次系统研究混合注意力 LLM 的多语言能力,发现层序可改

UCLA · hf · 2026-10-07

UCLA 发布首个关于混合注意力 LLM(全注意力+循环变体)如何影响多语言能力的研究。可解释性分析证实循环状态的归纳偏置确实改变语言处理方式:跨语言表征的发展模式与循环层和全注意力层的排列顺序相关,且在第一个全注意力层附近跨语言对齐显著飙升。在多语言数据蒸馏实验中,所有替代层序全程优于标准排序,学习速度最高快 2.5 倍。作者据此提出理论:多语言模型应从全注意力层而非循环层开始。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →