新 tokenizer 改造法让预训练模型泰语 token 减少 4 倍

kastnerkyle · x · 2026-07-23

这篇工作提出了一种在不从头重训的情况下,给预训练模型“换词表”的方法。作者不是简单地往 tokenizer 里硬加新词,而是继续做 BPE 学习,并配合 leaf-based vocabulary pruning 去掉冗余 token。

论文给出的效果很直接:

作者强调,tokenizer 虽然很少被关注,却会显著影响多语言模型的使用效率;这套方法也被开源成工具包。

所属事件:Liquid AI 原地扩容 LFM2 词表至 128K,多语言解码大幅提速(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →