计算最优 Tokenization 论文:模型参数应按字节数而非 Token 缩放
stochasticchasm · x · 2026-08-28
这篇论文系统研究了 Token 的信息粒度(压缩率)对语言模型缩放趋势的影响。作者训练了 988 个潜在 Token 化模型(BLT),实验揭示了两个关键发现:
- 在计算最优配置下,模型参数数量应与按字节衡量的数据量成正比,而不是普遍认为的按 Token 数量缩放。
- 最优压缩率与 BPE 获得的压缩率不同,且随计算预算的增加而降低。
该结论适用于潜在和子词 Token 化以及英语以外的语言。
「Infra」频道最新
- Anthropic与HHMI合作推出模型硬件标准,推动AI硬件互操作 — thebasepoint · 2026-08-28
- 富兰克林基金经理:AI 投资 ROI 决定芯片需求能否持续 — IBDinvestors · 2026-08-28
- Token 价格具有误导性:多轮筛选导致实际成本激增 — andreisavu · 2026-08-28
- Lambda 获 9.26 亿美元投资级贷款,用于 GPU 部署 — TheZachMueller · 2026-08-28
- 英美算力基建对比:英国受电网制约,美国协同建设 — NinaDSchick · 2026-08-28
- 推理两小时成本估算:Claude 或耗资 1382 万美元 — GregKamradt · 2026-08-28