继续 BPE 训练可提升分词器扩展与词表剪枝效果
burkov · x · 2026-07-25
Tokenizer 适配在把预训练语言模型迁移到新领域或新语言时很关键。本文聚焦两个互补操作:扩展词表与剪枝词表。
- 与其重新训练一个新 tokenizer、再把不重叠的 token 直接拼进去,作者提出 continued BPE training:在新数据上继续学习 BPE merge,沿用原有 tokenizer 结构进行扩展。
- 在多语言和多个模型家族上的实验显示,这种做法能提升分词效率,并让新增词表的利用率更高。
- 作者还提出 leaf-based vocabulary pruning,可以在尽量保持模型质量的前提下移除冗余 token。
- 相关方法已作为开源工具包发布,便于做受控的词表修改。
「研究」频道最新
- FrontierCode 设计解释了 Opus 5 推理越强分数越低 — silasalberti · 2026-07-25
- Nature 论文把病理医生浏览行为变成 AI agent 训练数据 — yuyinzhou_cs · 2026-07-25
- Surya Ganguli:理解 AI,物理学可能比定理证明更有用 — SuryaGanguli · 2026-07-25
- ARC-AGI-4 或该减少公开演示,Opus 5 在 ARC-AGI-3 领先 3 倍 — burny_tech · 2026-07-25
- 用 Claude 整理:NeurIPS 2024 研讨会汇总清单 — DanielKhashabi · 2026-07-25
- 微软 OpenForgeRL:在真实部署 harness 中训练智能体 — dair_ai · 2026-07-25