微软研究员:行采样比例与学习率联调,按 1/√f 放大改善收敛

JohnCLangford · x · 2026-08-14

John Langford 给出一条经验法则:更新时若只使用比例 f 的行,学习率应按 1/√f 相应放大;两者联合调整后,在部分模型上带来约 1 centinat 量级的收敛统计改善。该结论属于微软 Dion 优化器统计侧改进的一部分。

所属事件:微软优化器新发现:行归一化与行采样联调改善收敛(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →