Liquid AI 将模型 tokenizer 原地扩容到 12.8 万词表
pmttyji · reddit · 2026-07-22
Liquid AI 分享了 LFM2.5-8B-A1B 背后的 tokenizer 升级方法:它不是从头重训,而是对一个预训练模型的分词器做 in-place 扩容。
要点包括:
- 词表从 65K 扩到 128K。
- 目标是修复原 tokenizer 对某些语言切分过细的问题。
- 帖子同时给出了博客和 arXiv 技术报告,信息量更偏方法论而不是单纯模型发布。
配图展示了英文和泰文的对比:英文 token 数几乎不变,而泰文在扩容后能以更合理的方式切分,说明这种做法对多语言场景尤其有价值。
所属事件:Liquid AI 原地扩容 LFM2 词表提升多语言效率(4 条相关)→
「研究」频道最新
- 仿真到现实与评测正成为机器人仿真的核心环节 — m_wulfmeier · 2026-07-22
- 预测通过历史数据、模型与经验共同降低不确定性 — mdancho84 · 2026-07-22
- 季节分解把序列拆成趋势、季节性和残差 — mdancho84 · 2026-07-22
- 偏自相关会剥离前置滞后的干扰 — mdancho84 · 2026-07-22
- 自相关衡量序列与自身过去值的关系 — mdancho84 · 2026-07-22
- 时间序列分析关注带时间戳数据的模式 — mdancho84 · 2026-07-22