arXiv 原文:Meta 蒸馏字节模型破 token 上限,八大基准系统验证
alex_verem · x · 2026-10-10
论文《Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models》(Meta FAIR + 华盛顿大学,Zettlemoyer 等人参与)对字节级语言模型做了首个大规模系统研究。
- 提出两种把 token logits 转为字节 logits 的方法:近似的 Marginalize-It 和精确的 End-Of-Token(EOT)
- 系统扫描约 10 亿参数、最多 1 万亿字节数据的 decoder-only 模型,同时变动分词方案(token / byte / byte+EOT)与训练目标(蒸馏 vs 交叉熵)
- 在覆盖多选问答、文本生成、机器翻译的八项基准上:token 模型在低算力区间占优但会到达平台期;字节模型起步更差但随算力增长反超,性能天花板更高
- 缩放律外推:蒸馏 EOT-1B 渐近上可超过蒸馏 Token-1B 最多 4%,且数据效率高得多
这是对 tokenizer 必要性的首个大尺度实证反驳。
所属事件:Meta 新论文:字节模型经充分训练与蒸馏可反超 token 模型(2 条相关)→
「研究」频道最新
- Gym-Anything 获 COLM2026 Lifelong Agents 研讨会最佳论文 — dan_fried · 2026-10-10
- Ai2 发布 Olmo Hybrid:混合架构省 49% 训练 token 达同精度 — allen_ai · 2026-10-10
- 10月22日旧金山 AI for Science 活动:Agent 能否端到端跑科研 — nlarusstone · 2026-10-10
- 论文提出嵌套并行冯诺依曼架构:百万处理器仍是单一计算机 — bronzeagepapi · 2026-10-10
- UPenn 论文用「腐坏格」统一扩散与自回归,预判解码调度成本 — upenn · 2026-10-10
- CMU 教授 Keenan Crane 用 AI 做 3D 建模:效率差距大到得换回 CS 思维 — keenanisalive · 2026-10-10