三项式 scaling law 联合推导最优批次大小

orvieto_antonio · x · 2026-07-04

针对算力分配中「多走步数还是用更大批次」的问题,作者提出用三项式损失律 L(N,M,K)= E + A·N⁻ᵅ + B·M⁻ᵝ + C·K⁻ᵞ 来刻画,其中 M 为以 token 计的批次大小、K 为训练步数。相比以往单独拟合 batch-size law,这里批次大小直接进入损失律,因此最优批次与临界批次可被推导而非单独拟合。由于 D=MK(总 token 数),该律预测最优批次 M ∝ D^(γ/(β+γ))。文中附论文链接。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →