新 tokenizer 改造法让预训练模型泰语 token 减少 4 倍
kastnerkyle · x · 2026-07-23
这篇工作提出了一种在不从头重训的情况下,给预训练模型“换词表”的方法。作者不是简单地往 tokenizer 里硬加新词,而是继续做 BPE 学习,并配合 leaf-based vocabulary pruning 去掉冗余 token。
论文给出的效果很直接:
- 泰语 token 数减少 4.0 倍
- 越南语减少 2.6 倍
- 印地语减少 2.4 倍
- 在这些语言上,端侧按字符解码的速度估计可提升 2.2~3.7 倍
作者强调,tokenizer 虽然很少被关注,却会显著影响多语言模型的使用效率;这套方法也被开源成工具包。
所属事件:Liquid AI 原地扩容 LFM2 词表至 128K,多语言解码大幅提速(5 条相关)→
「模型」频道最新
- 网友热议 DeepSeek 新模型:K3 还是缩水版 K3-Flash? — teortaxesTex · 2026-09-11
- DeepSeek 新版多轮改 System Prompt 不再击穿缓存,费用省 36.6% — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11