训练小技巧:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快

kalomaze · x · 2026-10-07

kalomaze 分享一个自己刚验证的训练基线实验:对 20% 的样本,把所有层的全量 SWA(滑动窗口注意力)跨度在 2 的幂 128 到 512 之间随机化,观察到明显改进。他解释背后的原理是一个事后看「尴尬地显然」的准则:即便 RLVR 答案对模型是 held-out 的,也强迫模型通过推理推导正确答案,这是一种刻意制造的、更严酷的信息不对称——与常规数据增强不同,它在总信息更少的情况下反而让全序列长度的损失下降更快。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →