LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍

maximelabonne · x · 2026-07-21

一篇新文章讲的是如何扩展模型 tokenizer 以加入新语言

这篇博文介绍了团队如何扩展 LFM2 的 tokenizer,让它更高效地支持更多语言。

文中给出的例子是:LFM2.5-8B-A1B 把 tokenizer 从 65K 扩到 128K,目的是避免某些语言被切得过碎。带来的收益相当明显:

文章重点不是单纯展示结果,而是讲清楚了 如何在已有预训练模型上原地升级 tokenizer 的方法。

所属事件:Liquid AI将LFM2词表扩容至128K提升多语言效率(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →