3000 亿 token 等于连讲 1 万年:Fleuret 量化训练语料规模
francoisfleuret · x · 2026-09-09
前 Meta 研究科学家 Francois Fleuret 用一个类比量化 LLM 训练语料的规模:人类语速约为每小时 8000 词,3000 亿 token 约合 2300 亿词,相当于每天说话 8 小时连讲 1 万年。这一换算直观展示了模型训练所消耗的数据量远超个人一生所能产出的语言总量。
「研究」频道最新
- 学者警告:AI 时代的同行评审存在致命漏洞,传统评审将消亡 — deliprao · 2026-09-09
- OpenAI 宣布用智能体群解出纳维-斯托克斯千年数学难题 — soumitrashukla9 · 2026-09-09
- YC Paper Club 梳理 harness engineering 顶会论文合集 — dair_ai · 2026-09-09
- Split-LLM 训练隐私防线失守:零梯度模式泄露真实数据 — Setloop · 2026-09-09
- DAIR.AI 整理 21 篇论文:从采样循环到自我改写,看 Harness 六年演进 — omarsar0 · 2026-09-09
- OpenAI 解 Navier-Stokes 疑因听说"有人做到过"才尝试 — kohjingyu · 2026-09-09