Liquid AI 原地扩容 LFM2 词表至 128K,多语言解码大幅提速
Liquid AI 发布了一份技术报告与博客,介绍了其为预训练大模型 LFM2.5-8B-A1B 进行 tokenizer 原地扩容的工程实践。该方法无需从头重训模型,成功将词表从 65K 扩展到了 128K,旨在修复原有分词器对部分语言切分过细的问题,从而提升多语言处理效率。
已确认
据 @pmttyji 与 @kastnerkyle 的总结,研发团队并非简单粗暴地向词表中硬添加新词,而是继续进行 BPE(字节对编码)学习,并配合 leaf-based vocabulary pruning(基于叶子节点的词表裁剪)技术来剔除冗余的 token。这种原地扩容法有效平衡了词表规模的增加与原有模型知识的保留。
为什么重要
扩容后的 tokenizer 在多语言支持上取得了立竿见影的效果。@maximelabonne 指出,以泰语为例,优化后的分词器能将其 token 数量减少约 4 倍。此外,词表的翻倍改造不仅没有拖慢速度,反而让端侧设备的解码速度实现了最高 3.7 倍的提升,展示了极高的工程实用价值。
2026-07-21 ~ 2026-07-23 · 5 条相关
一手来源
- LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍 — maximelabonne ·
- Liquid AI 将模型 tokenizer 原地扩容到 12.8 万词表 — pmttyji ·
- 【源头】LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍 — maximelabonne · 2026-07-21
- Liquid AI 原地扩容预训练 tokenizer 到 128K — JosephJacks_ · 2026-07-21
- LFM2.5-8B-A1B 词表翻倍,端侧解码提速最高 3.7 倍 — maximelabonne · 2026-07-22
- 【源头】Liquid AI 将模型 tokenizer 原地扩容到 12.8 万词表 — pmttyji · 2026-07-22
- 新 tokenizer 改造法让预训练模型泰语 token 减少 4 倍 — kastnerkyle · 2026-07-23