计算最优 Tokenization 论文:模型参数应按字节数而非 Token 缩放

stochasticchasm · x · 2026-08-28

这篇论文系统研究了 Token 的信息粒度(压缩率)对语言模型缩放趋势的影响。作者训练了 988 个潜在 Token 化模型(BLT),实验揭示了两个关键发现:

该结论适用于潜在和子词 Token 化以及英语以外的语言。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →