Functionalizer 无损预分词,词表体积最多省 19.7%
cavelab · hf · 2026-09-23
cavelab 在 Hugging Face 发布 The Functionalizer,一种无损的预分词(pre-tokenizer)框架,解决子词分词器在词形变化上的痛点。
核心思路
- 传统子词分词器要么把 hello/Hello/HELLO/Héllo 等正字变体当作无关词条(碎片化嵌入空间),要么用有损归一化丢弃变化
- Functionalizer 在分词前把正字与结构变化分解为 opcode/operand 前缀流:规范化的基础 token(operand)+ 参数化变换算子(opcode),opcode 编码在 Unicode 私用区
- 引入覆盖大小写(CAPITALIZE)、变音符(13 个专用 opcode)、字符重复(REPEAT/MULTIREPEAT)等完全可逆的算子
实验结果
- 在自然语言与代码语料上,同等完全覆盖率下词表槽位需求最多降低 19.7%
- 98M 参数 GPT-2 下游评测:Python 代码语法有效率从 7.70% 提升到 9.12%,自然语言文本中重复 n-gram 减少
作者认为函数式分解是词表高效、结构感知语言建模的有效机制,但需在生产规模上进一步验证。
「研究」频道最新
- 研究称人体细胞或靠微弱生物光子互相通讯 — iamaliveix · 2026-09-23
- LeCun 转发新会议 ICWM:剑指臃肿的顶级 AI 大会 — ylecun · 2026-09-23
- JevBench 登陆 Hugging Face:Jev 仍居首但开源模型快速追近 — airesearch12 · 2026-09-23
- giffmana:仅凭论文本身无法判断作者是否真懂自己写的东西 — giffmana · 2026-09-23
- 粗算:3 万 AI 博士生年产出约 3 万篇论文,人均仅一篇 — SoloGen · 2026-09-23
- 推算:3 万 AI 博士生年产约 3 万篇论文,人均一篇 — SoloGen · 2026-09-23