3000 亿 token 等于连讲 1 万年:Fleuret 量化训练语料规模

francoisfleuret · x · 2026-09-09

前 Meta 研究科学家 Francois Fleuret 用一个类比量化 LLM 训练语料的规模:人类语速约为每小时 8000 词,3000 亿 token 约合 2300 亿词,相当于每天说话 8 小时连讲 1 万年。这一换算直观展示了模型训练所消耗的数据量远超个人一生所能产出的语言总量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →