论文称前沿模型在长串精确复制上仍会失手
eyishazyer · x · 2026-07-27
这条回复在概括一篇研究:前沿语言模型虽然能完成高级推理任务,但在精确复制长串、重复字符串时仍会明显失手。
- 输入越长、重复模式越多,复制越不稳定。
- 论文认为问题部分来自架构:标准 1D RoPE 下,生成输出 token yk 需要按一个随输入长度变化的相对偏移去取回 xk。
- 这说明,哪怕是“照抄”这种看似简单的能力,也会被位置编码与架构选择显著影响。
所属事件:研究指1D-RoPE缺陷致大模型长串复制失手(2 条相关)→
「研究」频道最新
- Agent 架构法则:验证器可参与生成反馈,但不得直接晋升候选解 — blaizedsouza · 2026-09-23
- q-Neurons:用随机 q 导数激活函数提升神经网络性能 — FrnkNlsn · 2026-09-23
- 曝 OpenAI 将办期刊:内部模型多 agent 评审,冲击 ML 会议 — kfountou · 2026-09-23
- 耶鲁博士生开源顶会论文画图脚本,还能接入 Claude Code 当 Skill — burny_tech · 2026-09-23
- AI 在 ForecastBench 上追平超级预测员,10 月将再战 — burny_tech · 2026-09-23
- 几句 prompt 让 Opus 用 Lean 形式化验证 Agent SDK,产出 16 个修 bug PR — bcherny · 2026-09-23