Meta 论文:算力足够大时字节级模型反超 token 模型最高 4%
omarsar0 · x · 2026-09-14
- Meta 论文显示:字节级模型在低算力时落后于 token 模型,但随着算力增长会实现反超。实验基于在最多 1 万亿字节上训练的蒸馏 1B 模型。
- 蒸馏方法:将 token 教师模型的 logits 转换为字节 logits,有近似(Marginalize-It)与精确(End-Of-Token)两种方式。
- 关键结论:token 模型低算力领先但性能有平台期;字节模型上限更高,拟合的 scaling law 预测 End-Of-Token 模型最终领先蒸馏 token 模型最多 4%。
- 效率收益:字节模型用六分之一的训练数据即可追平蒸馏 token 模型;256 词条的小词表可把教师 logits 存储压缩到约五分之一。
「研究」频道最新
- Old School RuneScape 被搬进 PufferLib 5.0,成强化学习训练环境 — neuroecology · 2026-09-15
- 倒着造谜题:滑铁卢大学发布 2 万题 ORBIT 数据集训练搜索 agent — CShorten30 · 2026-09-15
- 二倍体感知的基因组语言模型发布:多数模型训练用的基因组并不真实存在 — OdedRechavi · 2026-09-15
- 4000 次实测:96 个工具只掉 9 分,agent 第三轮才是真瓶颈 — EastVersion1226 · 2026-09-15
- 层丛上同调视角解析预测编码网络:Hodge 分解揭示学习何时停滞 — burny_tech · 2026-09-15
- 表格基础模型学习路径:从 Molnar 开源书到 nanoTabPFN 实践 — pandeyparul · 2026-09-15