论文称前沿模型在长串精确复制上仍会失手
eyishazyer · x · 2026-07-27
这条回复在概括一篇研究:前沿语言模型虽然能完成高级推理任务,但在精确复制长串、重复字符串时仍会明显失手。
- 输入越长、重复模式越多,复制越不稳定。
- 论文认为问题部分来自架构:标准 1D RoPE 下,生成输出 token yk 需要按一个随输入长度变化的相对偏移去取回 xk。
- 这说明,哪怕是“照抄”这种看似简单的能力,也会被位置编码与架构选择显著影响。
所属事件:研究指1D-RoPE缺陷致大模型长串复制失手(2 条相关)→
「研究」频道最新
- StateAct 论文主张电脑使用智能体先建模程序状态 — _akhaliq · 2026-07-28
- Cursor 详解 agent swarm:上下文更小,SQLite 基准冲到 80% — bibryam · 2026-07-28
- 物理 AI 可能让工业机器人更容易部署 — Responsible-Grass452 · 2026-07-28
- 1983 年 Topo 机器人:先跑代码,后感知世界 — tobowers · 2026-07-28
- Papers with Code 机器人专题页追踪主流基准与趋势 — NielsRogge · 2026-07-28
- 从 Universal Transformers 到 DeepLoop 的循环 Transformer 脉络 — KyeGomezB · 2026-07-28