两篇新论文:递归语言模型域外泛化;XMerge 层剪枝深度压缩

burny_tech · x · 2026-09-23

帖子转发了两篇 LLM 研究:

Recursive Language Models Generalize Out of Domain(Toyota Technological Institute at Chicago,C. Yang、Z. Li、D. McAllester、N. Srebro):研究递归式语言模型(RLM)在分布外的泛化能力。

XMerge(arXiv:2609.02083):一种免训练的 LLM 深度压缩方法,含两个组件——跨轴选择(识别隐状态相对幅度与角度变化都低的层块)与局部边界重建(重拟合相邻存活块以还原原两块输出)。无需任务标签或端到端微调,不改动架构、不增加推理参数。在 7 个 Llama/Qwen 骨干(0.5B–8B)、5 个基线、3 个剪层强度下,剪 4 层时在 7 个骨干中的 6 个上于 CORE 与 MMLU 排名第一,且是唯一在全部 14 个(模型,剪枝)组合中从不崩溃的方法,避免了同类算子的大幅困惑度上升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →