前OpenAI研究员:原始Scaling Law论文存致命bug,行业算力或遭大量浪费
新智元 · wechat · 2026-07-05
前OpenAI研究员Diogo Almeida发文指出,2020年OpenAI发布的Scaling Law论文存在根本性bug:对所有参数量的模型使用了固定的token数量和余弦学习率衰减,导致大模型严重"营养不良",小模型被"喂饱",从而错误地得出"优先堆参数"的结论。DeepMind研究员Sander Dieleman转发指出,这一bug可能导致业界在"体量过大、训练不足"的模型上白白浪费了大量算力。
2022年DeepMind的Chinchilla论文已将该结论推翻,指出模型参数与数据量应同等重要地扩展,约每个参数配20个token。然而后续研究发现,Chinchilla论文本身也存在bug——优化器中的Huber损失按样本求均值而非求和,导致拟合提前终止。纠正bug的论文自带另一个bug。
文章指出Scaling Law本质是经验拟合曲线,并非铁打的物理定律。这段历史揭示了一个深层问题:整个AI行业曾将一条存在缺陷的曲线奉为"第一性原理",并在此基础上做出了大量算力配置决策。
所属事件:前OpenAI研究员称原始Scaling Law论文存致命bug(2 条相关)→
「Infra」频道最新
- WEKA NeuralMesh 被指在 GPU 服务器上可接近 HBM3 带宽 — AccBalanced · 2026-07-27
- Nvidia 被调侃成开源 AI 领头羊,仓库图却真排第一 — AccBalanced · 2026-07-27
- 8 美元 ESP32-S3 竟能离线跑 2890 万参数模型 — yangyi · 2026-07-27
- YC 演讲谈 BCI × AI:真正决定速度的是基础设施 — garrytan · 2026-07-27
- 13B 模型靠 SSD 分页在无独显电脑上离线跑通 — ID_R_McGregor · 2026-07-27
- llama.cpp 提醒:旧版 GGUF 在新改动后必须重生成 — EconomySerious · 2026-07-27