微软优化器新发现:行归一化与行采样联调改善收敛

微软研究员John Langford介绍,团队将Normuon的行归一化整合进Dion的行选择策略后,观察到小幅统计性改善。同时给出经验法则:更新时若只使用比例f的行,学习率应按1/√f放大,两者联合调整在部分模型上带来约1 centinat量级的收敛统计改善。

2026-08-14 ~ 2026-08-14 · 2 条相关