仅加32个参数:LeRoPE让大模型位置编码频率自学习,效果全面超越RoPE
burny_tech · x · 2026-07-30
ICML 论文提出了 LeRoPE(Learnable RoPE Frequencies),指出当前大模型依赖人工挑选的 RoPE 频率来理解 Token 位置,而将其改为可学习模式后效果更好。
- 极低参数开销:仅额外引入 32 个参数,LeRoPE 在多种规模模型上的表现均超越了标准 RoPE。
- 发现主导频段:模型在训练中自然演化出一个约等于训练上下文长度 2.2 倍的主导位置频段。
「研究」频道最新
- 优化测试框架即破纪录,ARC-AGI-3 被指不能反映真实能力 — Angaisb_ · 2026-07-30
- 单机 8x 5090 实现 167k tokens/s 训练吞吐,超越 DDP 基线 — jon_durbin · 2026-07-30
- 为何没人测过用 ResNet MLP 替代大部分注意力层? — kalomaze · 2026-07-30
- AI失控如何提前预测?清华剑桥提出失控行为框架 — 机器之心 · 2026-07-30
- 无人机高光谱成像结合人在回路,优化地雷探测效率 — RITiger · 2026-07-30
- GPT-5.6 成功验证新数学定理,突破 Ramsey 数下界 — naval · 2026-07-30