Randomized YaRN 问世:短文本训练即可提升 128K 上下文推理

gregd_nlp · x · 2026-09-05

manasmehta20 介绍了一项将出现在 EMNLP 2026 Findings 的研究:直接用 YaRN 做长上下文扩展,不足以支撑 LLM 在 128K 上下文的推理能力。

论文提出 Randomized YaRN(RYaRN):训练时仍使用短上下文数据,但从更长的位置范围内随机采样位置编码。结果显示,RYaRN 能提升分布外(OOD)推理准确率,改善在 128K 上下文处的表现。这是一种几乎不增加训练数据成本的上下文扩展技巧。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →