Mistral 研究员:15T tokens 低估了,预训练实际约 40T+
eliebakouch · x · 2026-10-08
Mistral 前研究员 Elie Bakouch 在讨论预训练算力估算时指出,常见引用的 15T tokens 训练量是低估,实际应在 40T+ 左右,相应地 wall clock 训练时间要乘 3-4 倍;MFU 和 goodput 的估计则合理或略偏乐观。
他还强调一个常见误区:预训练 FLOPs 应按 激活参数量 而非总参数量计算——所谓"1000 参数的模型"的说法就混淆了这一点。他表示估算本意不是精确数值,而是说明预训练所需算力是可以达到的量级。
「Infra」频道最新
- AI 性能工程资源库上线,GPU MODE 讲座全套收录 — ycombinator · 2026-10-08
- CoreWeave Fully Connected 大批产品齐发,SVP 首先向自家团队道歉 — thursdai_pod · 2026-10-08
- DuckDB 官方演示「零数据」数据库:几百 KB 管理整个数据湖 — RexDouglass · 2026-10-08
- Yudkowsky:预训练算力份额已降至 7%,能力尖峰预测重新生效 — repligate · 2026-10-08
- National Compute 上线数百台 MI355x 与 B300,免费补贴高校与政府 — ycombinator · 2026-10-08
- 微软 Windows 发布会秀本地模型,GitHub 推出 Auto 模型路由 — DanWahlin · 2026-10-08