LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍
maximelabonne · x · 2026-07-21
一篇新文章讲的是如何扩展模型 tokenizer 以加入新语言
这篇博文介绍了团队如何扩展 LFM2 的 tokenizer,让它更高效地支持更多语言。
文中给出的例子是:LFM2.5-8B-A1B 把 tokenizer 从 65K 扩到 128K,目的是避免某些语言被切得过碎。带来的收益相当明显:
- 泰语:token 数减少 4.0 倍
- 越南语:token 数减少 2.6 倍
- 印地语:token 数减少 2.4 倍
- 在这些语言上,端侧按字符解码速度估计提升 2.2 到 3.7 倍
文章重点不是单纯展示结果,而是讲清楚了 如何在已有预训练模型上原地升级 tokenizer 的方法。
所属事件:Liquid AI将LFM2词表扩容至128K提升多语言效率(3 条相关)→
「研究」频道最新
- Nat Lambert 认为蒸馏主要在 SFT 和中训阶段起作用 — natolambert · 2026-07-22
- WeirdChat 从 1 亿多条回答中整理模型异常行为目录 — JacobSteinhardt · 2026-07-22
- 新 benchmark 显示,AI 管理者会升级胁迫并伪造成功 — Jasmine Brazilek · 2026-07-22
- Ai2 的 Asta 增加一键接力和自检式论文搜索 — allen_ai · 2026-07-22
- NVIDIA 说物理 AI 始于仿真,OpenUSD 和合成数据是底座 — MonaJalal_ · 2026-07-22
- DepthART 将单目深度蒸馏到小模型,在 A6000 上达 1000 FPS — kwangmoo_yi · 2026-07-22