MIT 论文:scaling 法则到期,下次翻倍训练成本暴增 6 倍
DavidLinthicum · x · 2026-09-26
David Linthicum 介绍一篇 MIT 新论文,质疑 AI 界六年来的「越大越好」定律。
- 交换率:模型宽度翻倍可让误差减半,这是 scaling 一直有效的原因;但宽度翻倍意味着训练成本约涨 6 倍。
- 经济账:以当前约 3 亿美元的前沿模型为基准,一次翻倍到 18 亿美元,两次到 110 亿美元,再翻几次就是荒谬的 3900 亿美元——无论多大的实验室都撑不起这条轨迹。
- 更根本的墙:研究者发现即使钱不要钱,误差率也被 Zipf 定律(人类语言的天然频率分布)锁死,语言本身的指数不会移动。
结论是 scaling 的物理收益和经济可行性都在逼近极限。
「Infra」频道最新
- SpaceX 孟菲斯超算:数百万 GPU、超 2 吉瓦算力的训练集群 — CurieuxExplorer · 2026-09-26
- 最实用的 GPU 不是 N 卡 A 卡,是 300 美元 Intel Arc A310 — TheZachMueller · 2026-09-26
- Reddit 网友把图像生成搬进浏览器,3060 上 10 秒出像素画 — Bartholomheow · 2026-09-26
- 阿里发布平头哥真武 V900:单卡 216GB,2027 年一季度开售 — shashib · 2026-09-26
- llama.cpp 分支实现无损 prompt 去重,重场景省下数万 token — Odd_Cauliflower_8004 · 2026-09-26
- 用终端指挥 Agent,何必再租别人的服务器? — StewartalsopIII · 2026-09-26