UCLA 首次系统研究混合注意力 LLM 的多语言能力,发现层序可改
UCLA · hf · 2026-10-07
UCLA 发布首个关于混合注意力 LLM(全注意力+循环变体)如何影响多语言能力的研究。可解释性分析证实循环状态的归纳偏置确实改变语言处理方式:跨语言表征的发展模式与循环层和全注意力层的排列顺序相关,且在第一个全注意力层附近跨语言对齐显著飙升。在多语言数据蒸馏实验中,所有替代层序全程优于标准排序,学习速度最高快 2.5 倍。作者据此提出理论:多语言模型应从全注意力层而非循环层开始。
「研究」频道最新
- OpenAI 问题 #109 再收紧:κ 改进约 5.7 亿倍,逼近理论上限 — aran_nayebi · 2026-10-07
- Datology 开源 Zephon:确定性流式 dataloader 解决 GPU 数量不一致难题 — josh_wills · 2026-10-07
- NVIDIA 论文 VERA:让 Agent 框架与模型共同进化,9B 版超出基线 10 分 — omarsar0 · 2026-10-07
- Isomorphic Labs 成 Virtual Biology Initiative 创始成员,开放生物数据 — proteinrosh · 2026-10-07
- MIT 把编码 agent 丢上无人岛 30 小时,研究机器「玩耍」 — phillip_isola · 2026-10-07
- GPT-7「证明」乘法提速 0.0000000000163%,数学家笑了 — jxmnop · 2026-10-07