Liquid AI将LFM2词表扩容至128K提升多语言效率
Liquid AI发布了关于原地扩展预训练tokenizer的技术报告,在不从零重训的情况下,将LFM2.5-8B-A1B模型的词表从65K提升至128K。此次扩容专门修复了原先将部分语言切得过细的问题,例如使泰语token数量大幅减少4倍,并使端侧解码速度最高提升3.7倍,显著改善了模型的多语言处理效率。
2026-07-21 ~ 2026-07-22 · 3 条相关
- LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍 — maximelabonne · 2026-07-21
- Liquid AI 原地扩容预训练 tokenizer 到 128K — JosephJacks_ · 2026-07-21
- LFM2.5-8B-A1B 词表翻倍,端侧解码提速最高 3.7 倍 — maximelabonne · 2026-07-22