Mistral 研究员:15T tokens 低估了,预训练实际约 40T+

eliebakouch · x · 2026-10-08

Mistral 前研究员 Elie Bakouch 在讨论预训练算力估算时指出,常见引用的 15T tokens 训练量是低估,实际应在 40T+ 左右,相应地 wall clock 训练时间要乘 3-4 倍;MFU 和 goodput 的估计则合理或略偏乐观。

他还强调一个常见误区:预训练 FLOPs 应按 激活参数量 而非总参数量计算——所谓"1000 参数的模型"的说法就混淆了这一点。他表示估算本意不是精确数值,而是说明预训练所需算力是可以达到的量级。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →