2D-RoPE 让前沿大模型更稳定地复制长字符串
rohanpaul_ai · x · 2026-07-27
前沿大模型虽然能做复杂推理,却仍然会在一个更简单的任务上失手:长而重复的字符串精确复制。
论文认为,标准 1D RoPE 在序列变长时会让“要复制的 token 偏移”变得更难对齐,因此复制性能会下降。作者提出 2D-RoPE,把文本视为二维网格,为 token 同时分配行 ID 和列 ID,让对应位置在同一列上对齐。
主要结果:
- 在合成复制任务中,只用单层训练、训练长度为 1–100 的模型,在推理时对 长 1,000 倍 的输入仍可做到完美复制。
- 这一优势也出现在最高 1.4B 参数 的预训练模型上。
- 在测试规模下,常识能力基本保持相当。
作者也指出,这种方法仍然依赖换行结构,因此还不是通用解法。
所属事件:研究指1D-RoPE缺陷致大模型长串复制失手(2 条相关)→
「研究」频道最新
- Baseten 工程师拆解 Kimi K3:七年迭代不是只靠堆参数 — khademinori · 2026-07-28
- 开源基准工具可安全统计 coding agent token 消耗 — bestofdesp · 2026-07-28
- 研究者回应审稿:观察性数据也能做因果推断 — yanaiela · 2026-07-28
- 更强模型也可能拖垮产品,先做生产任务测试 — max_gladysh · 2026-07-28
- RepLLM 用四个智能体把网络论文复现压到两小时内 — 机器之心 · 2026-07-28
- Vision-OPD 用 6.2K 合成样本提升细粒度视觉理解 — 小红书技术REDtech · 2026-07-28