前沿模型仍会翻车于精确复制
dair_ai · x · 2026-07-21
关键信息
前沿语言模型虽然能做复杂推理,但在一个看似简单的能力上仍会翻车:准确复制一大段文本。
为什么重要
论文指出,这不只是“抄文本”这么简单。代码、表格、结构化文档,以及很多 agent 工作流,都依赖模型稳定地保持原文格式与顺序。
方法
作者认为问题与 Transformer 的位置编码有关,于是提出把文本从 1D token 序列改成 2D 布局 来看,并设计 2D-RoPE:给每个 token 分配行号和列号,把复制任务变成更容易的检索问题。
结果
- 在合成复制实验中,使用 2D-RoPE 的浅层 Transformer 能在远长于训练长度的文本上实现完美复制。
- 传统位置编码明显落后。
- 在更大规模的 DCLM 预训练中,这种优势也能保持,模型规模最高到 1.4B 参数。
结论
作者认为,把文本视为 2D 结构可能有助于语言建模,2D 位置编码值得进一步探索。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22