Liquid AI 原地扩容 LFM2 词表至 128K,多语言解码大幅提速

Liquid AI 发布了一份技术报告与博客,介绍了其为预训练大模型 LFM2.5-8B-A1B 进行 tokenizer 原地扩容的工程实践。该方法无需从头重训模型,成功将词表从 65K 扩展到了 128K,旨在修复原有分词器对部分语言切分过细的问题,从而提升多语言处理效率。

已确认

据 @pmttyji 与 @kastnerkyle 的总结,研发团队并非简单粗暴地向词表中硬添加新词,而是继续进行 BPE(字节对编码)学习,并配合 leaf-based vocabulary pruning(基于叶子节点的词表裁剪)技术来剔除冗余的 token。这种原地扩容法有效平衡了词表规模的增加与原有模型知识的保留。

为什么重要

扩容后的 tokenizer 在多语言支持上取得了立竿见影的效果。@maximelabonne 指出,以泰语为例,优化后的分词器能将其 token 数量减少约 4 倍。此外,词表的翻倍改造不仅没有拖慢速度,反而让端侧设备的解码速度实现了最高 3.7 倍的提升,展示了极高的工程实用价值。

2026-07-21 ~ 2026-07-23 · 5 条相关

一手来源