Randomized YaRN 问世:短文本训练即可提升 128K 上下文推理
gregd_nlp · x · 2026-09-05
manasmehta20 介绍了一项将出现在 EMNLP 2026 Findings 的研究:直接用 YaRN 做长上下文扩展,不足以支撑 LLM 在 128K 上下文的推理能力。
论文提出 Randomized YaRN(RYaRN):训练时仍使用短上下文数据,但从更长的位置范围内随机采样位置编码。结果显示,RYaRN 能提升分布外(OOD)推理准确率,改善在 128K 上下文处的表现。这是一种几乎不增加训练数据成本的上下文扩展技巧。
「研究」频道最新
- 腾讯论文提出环境进化:不盯 agent 也能持续生成更难的 RL 训练环境 — omarsar0 · 2026-09-05
- 微软神经符号系统 AgentScope 精准定位 agent 80 步前的失败点 — dair_ai · 2026-09-05
- 研究者放出 Qwen3.5-2B 第 12 层子空间可视化 — Sauers_ · 2026-09-05
- EMNLP 论文:AI 生成文本跨模型跨领域有一致风格指纹,AI 修改文本不同 — najoungkim · 2026-09-05
- Knuth TAOCP 全卷开放难题整理成数据集,称其为前沿模型最佳基准 — sytelus · 2026-09-05
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05