Hugging Face 认为 LLM 并不存在真正无分词方案

cjmaddison · x · 2026-07-29

LLM 分词器不是“根源”,但也不是可以直接抹掉

这条引用了 Hugging Face 的长文,核心观点是:所谓“tokenize-free”并不真正存在,因为即便换成 UTF-8 字节编码,也只是把一部分设计选择转移到了别处,并没有消除取舍。

配图进一步反驳了把 LLM 各种怪现象都归罪于分词器的说法——包括拼写、倒序、非英语、算术、Python 代码、过早停止以及空白字符处理等。文章认为,分词器往往也是解决方案的一部分,比如可以在训练前识别并移除容易出问题的 glitch tokens,而不是彻底废掉这个范式。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →