前OpenAI研究员:原始Scaling Law论文存致命bug,行业算力或遭大量浪费
新智元 · wechat · 2026-07-05
前OpenAI研究员Diogo Almeida发文指出,2020年OpenAI发布的Scaling Law论文存在根本性bug:对所有参数量的模型使用了固定的token数量和余弦学习率衰减,导致大模型严重"营养不良",小模型被"喂饱",从而错误地得出"优先堆参数"的结论。DeepMind研究员Sander Dieleman转发指出,这一bug可能导致业界在"体量过大、训练不足"的模型上白白浪费了大量算力。
2022年DeepMind的Chinchilla论文已将该结论推翻,指出模型参数与数据量应同等重要地扩展,约每个参数配20个token。然而后续研究发现,Chinchilla论文本身也存在bug——优化器中的Huber损失按样本求均值而非求和,导致拟合提前终止。纠正bug的论文自带另一个bug。
文章指出Scaling Law本质是经验拟合曲线,并非铁打的物理定律。这段历史揭示了一个深层问题:整个AI行业曾将一条存在缺陷的曲线奉为"第一性原理",并在此基础上做出了大量算力配置决策。
所属事件:前OpenAI研究员称原始Scaling Law论文存致命bug(2 条相关)→
「Infra」频道最新
- 华为发布近封装光学新标准,挑战英伟达与博通 — pstAsiatech · 2026-09-11
- Redis 只作缓存就关掉快照和日志,磁盘占用大幅下降 — DanielLockyer · 2026-09-11
- AI 利润大涨,美光给台湾 1.5 万员工每人约 3.2 万美元奖金 — Polymarket · 2026-09-11
- 不改模型给 Qwen3-8B 加近似层,预填充时间砍半 — teortaxesTex · 2026-09-11
- 一天烧完两次 ChatGPT 额度,网友造新词「老黄—奥特曼定律」 — yihui_indie · 2026-09-11
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11