Liquid AI 将模型 tokenizer 原地扩容到 12.8 万词表

pmttyji · reddit · 2026-07-22

Liquid AI 分享了 LFM2.5-8B-A1B 背后的 tokenizer 升级方法:它不是从头重训,而是对一个预训练模型的分词器做 in-place 扩容。

要点包括:

配图展示了英文和泰文的对比:英文 token 数几乎不变,而泰文在扩容后能以更合理的方式切分,说明这种做法对多语言场景尤其有价值。

所属事件:Liquid AI 原地扩容 LFM2 词表提升多语言效率(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →