Liquid AI 将模型 tokenizer 原地扩容到 12.8 万词表
pmttyji · reddit · 2026-07-22
Liquid AI 分享了 LFM2.5-8B-A1B 背后的 tokenizer 升级方法:它不是从头重训,而是对一个预训练模型的分词器做 in-place 扩容。
要点包括:
- 词表从 65K 扩到 128K。
- 目标是修复原 tokenizer 对某些语言切分过细的问题。
- 帖子同时给出了博客和 arXiv 技术报告,信息量更偏方法论而不是单纯模型发布。
配图展示了英文和泰文的对比:英文 token 数几乎不变,而泰文在扩容后能以更合理的方式切分,说明这种做法对多语言场景尤其有价值。
所属事件:Liquid AI 原地扩容 LFM2 词表至 128K,多语言解码大幅提速(5 条相关)→
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11