三项式 scaling law 联合推导最优批次大小
orvieto_antonio · x · 2026-07-04
针对算力分配中「多走步数还是用更大批次」的问题,作者提出用三项式损失律 L(N,M,K)= E + A·N⁻ᵅ + B·M⁻ᵝ + C·K⁻ᵞ 来刻画,其中 M 为以 token 计的批次大小、K 为训练步数。相比以往单独拟合 batch-size law,这里批次大小直接进入损失律,因此最优批次与临界批次可被推导而非单独拟合。由于 D=MK(总 token 数),该律预测最优批次 M ∝ D^(γ/(β+γ))。文中附论文链接。
「研究」频道最新
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27