2D-RoPE 让前沿大模型更稳定地复制长字符串
rohanpaul_ai · x · 2026-07-27
前沿大模型虽然能做复杂推理,却仍然会在一个更简单的任务上失手:长而重复的字符串精确复制。
论文认为,标准 1D RoPE 在序列变长时会让“要复制的 token 偏移”变得更难对齐,因此复制性能会下降。作者提出 2D-RoPE,把文本视为二维网格,为 token 同时分配行 ID 和列 ID,让对应位置在同一列上对齐。
主要结果:
- 在合成复制任务中,只用单层训练、训练长度为 1–100 的模型,在推理时对 长 1,000 倍 的输入仍可做到完美复制。
- 这一优势也出现在最高 1.4B 参数 的预训练模型上。
- 在测试规模下,常识能力基本保持相当。
作者也指出,这种方法仍然依赖换行结构,因此还不是通用解法。
所属事件:研究指1D-RoPE缺陷致大模型长串复制失手(2 条相关)→
「研究」频道最新
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23
- 基因组语言模型 Minerva 发现新型 ncRNA 阵列,助力生物发现 — BrianHie · 2026-09-23
- OfirPress 质疑新榜单算法:子集挑题+平均通过率,掩盖任务真实完成度 — OfirPress · 2026-09-23
- 剑桥出版高维统计新教科书,Samworth 与 Shah 合著免费开放 — FrnkNlsn · 2026-09-23
- Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍 — burny_tech · 2026-09-23
- 论文:Transformer 并非没有世界模型,而是特征叠加互相干扰 — burny_tech · 2026-09-23