前沿模型仍会翻车于精确复制
dair_ai · x · 2026-07-21
关键信息
前沿语言模型虽然能做复杂推理,但在一个看似简单的能力上仍会翻车:准确复制一大段文本。
为什么重要
论文指出,这不只是“抄文本”这么简单。代码、表格、结构化文档,以及很多 agent 工作流,都依赖模型稳定地保持原文格式与顺序。
方法
作者认为问题与 Transformer 的位置编码有关,于是提出把文本从 1D token 序列改成 2D 布局 来看,并设计 2D-RoPE:给每个 token 分配行号和列号,把复制任务变成更容易的检索问题。
结果
- 在合成复制实验中,使用 2D-RoPE 的浅层 Transformer 能在远长于训练长度的文本上实现完美复制。
- 传统位置编码明显落后。
- 在更大规模的 DCLM 预训练中,这种优势也能保持,模型规模最高到 1.4B 参数。
结论
作者认为,把文本视为 2D 结构可能有助于语言建模,2D 位置编码值得进一步探索。
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11