微软研究员:行采样比例与学习率联调,按 1/√f 放大改善收敛
JohnCLangford · x · 2026-08-14
John Langford 给出一条经验法则:更新时若只使用比例 f 的行,学习率应按 1/√f 相应放大;两者联合调整后,在部分模型上带来约 1 centinat 量级的收敛统计改善。该结论属于微软 Dion 优化器统计侧改进的一部分。
所属事件:微软优化器新发现:行归一化与行采样联调改善收敛(2 条相关)→
「研究」频道最新
- MiniMax Music3训练揭秘:为何必须用RVQ tokenizer? — ostrisai · 2026-08-14
- 哲学家Chalmers分析Anthropic J-space:并非全局工作空间 — burny_tech · 2026-08-14
- 中国化学遗传学临床试验未在 ClinicalTrials.gov 注册,需关注中国试验注册库 — MWCvitkovic · 2026-08-14
- 新研究提出通用手部动作空间,实现跨机器人手型技能迁移 — chris_j_paxton · 2026-08-14
- 多元正态分布Fisher-Rao距离可任意精度近似 — FrnkNlsn · 2026-08-14
- 大规模研究揭示运动与脂联素可延缓卵巢衰老 — EricTopol · 2026-08-14