Skaling: Chinchilla's Exponents Meet Kaplan's Coupling
Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja
cs.CL
2026-08-07
标准缩放律把模型大小和数据当独立可加,两端系统性偏。Skaling 加一个耦合指数,1.5 到 3 倍降误差,L 形采样约 10 倍省算力。
缩放律用模型大小 N 和训练数据 D 预测损失,是分配算力的核心工具。现在最常用的 Chinchilla 形式是可加的:L = A/N^α + B/D^β + E。这个结构隐含一个假设:N 和 D 对损失的影响相互独立(交叉导数恒为零)。但数据稀缺(小模型多训)和过训练(大模型少训)这两端,Chinchilla 会系统性偏掉,误差集中在网格角落。
Skaling 把可加的两项之和整体提一个外层幂 k:L = (A/N^α + B/D^β)^k + E。k 等于 1 时退化回 Chinchilla;k 不等于 1 时重新引入 N 与 D 的耦合(交叉导数非零),像早期的 Kaplan 形式,但保留了 Chinchilla 独立的内层指数(Kaplan 把内层项也绑死了)。只多一个参数。两条好性质还在:k 大于 0 时损失对 N 和 D 都严格单调降;算力最优分配的闭式解和 Chinchilla 一样(D/N 比例有解析式)。
配套一个「L 形采样」:全网格的算力几乎都被右上角(最大模型加最长训练)吃掉,所以只在最小模型上扫 D、在最短训练上扫 N,用大约 10 倍更少的算力标定参数。可加耦合结构不是唯一选择,论文在附录里对比了乘性耦合和加性交互项,结论是提幂的乘性耦合拟合更好。来自 FAIR(Meta)。
| 区间(Farseer 全网格) | Chinchilla MAPE | Skaling MAPE |
| 外推 N | 1.48 | 0.47 |
| 外推 D | 1.98 | 0.88 |
| 远外推 | 2.46 | 2.31 |
在 SK-Grid 上,远外推 MAPE 从 5.17 降到 0.70。在 L 形网格(约 10 倍更少算力)上,Skaling 仍接近或好过全网格的 Chinchilla。整体 MAPE 降 1.5 到 3 倍。算力最优的 token 与参数比,Chinchilla 预测的比例会随规模漂移,到前沿算力规模累积到 100 倍偏差,Skaling 更贴合真实趋势。
实用价值是「用小实验预测大模型」。多一个参数换来 1.5 到 3 倍的预测精度,配上 L 形采样能用约 10 倍更少的 profiling 算力外推全网格,直接省下一次缩放律扫描的算力。对前沿实验室(它们常锁死一个 token 与参数比,比如 DeepSeek)来说,算力最优比例算不准会真实惩罚到性能,所以比例偏差 100 倍这条比损失预测本身更值得重视。
只在两个网格(Farseer 公开数据加上自采的 SK-Grid)上验证,换架构或数据分布能否保持,没有测。多一个参数 k 理论上更易过拟合,作者靠交叉验证的方差说明还算稳,但远外推在 Farseer 全网格上仍有 2.31 的 MAPE(各项里最高)。可加结构和耦合结构哪个在物理上更对,没有定论;Skaling 是个工程上更好用的参数化,不是对损失产生机理的解释。