训练小技巧:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快
kalomaze · x · 2026-10-07
kalomaze 分享一个自己刚验证的训练基线实验:对 20% 的样本,把所有层的全量 SWA(滑动窗口注意力)跨度在 2 的幂 128 到 512 之间随机化,观察到明显改进。他解释背后的原理是一个事后看「尴尬地显然」的准则:即便 RLVR 答案对模型是 held-out 的,也强迫模型通过推理推导正确答案,这是一种刻意制造的、更严酷的信息不对称——与常规数据增强不同,它在总信息更少的情况下反而让全序列长度的损失下降更快。
「研究」频道最新
- 模型如何学出隐私信号:推理压力是更强的信息不对称 — kalomaze · 2026-10-07
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- Judea Pearl 点赞《Crush Coarse》论文,称其值得读 — yudapearl · 2026-10-07
- Hermes Index 由四套基准构成,含全新自研 Hermes Bench — NousResearch · 2026-10-07
- ProofAtlas 发布 LLM 评估的 500 大数学开放问题排名 — RexDouglass · 2026-10-07
- COLM 2026 杰出论文奖揭晓,CMU 团队获奖致谢 — dan_fried · 2026-10-07