Hugging Face 认为 LLM 并不存在真正无分词方案
cjmaddison · x · 2026-07-29
LLM 分词器不是“根源”,但也不是可以直接抹掉
这条引用了 Hugging Face 的长文,核心观点是:所谓“tokenize-free”并不真正存在,因为即便换成 UTF-8 字节编码,也只是把一部分设计选择转移到了别处,并没有消除取舍。
配图进一步反驳了把 LLM 各种怪现象都归罪于分词器的说法——包括拼写、倒序、非英语、算术、Python 代码、过早停止以及空白字符处理等。文章认为,分词器往往也是解决方案的一部分,比如可以在训练前识别并移除容易出问题的 glitch tokens,而不是彻底废掉这个范式。
「研究」频道最新
- Anthropic Claude 破解后量子密码,加速 AES 攻击数百倍 — petrusenko_max · 2026-07-29
- 技术报告解读:外部模型初始化视觉编码器并非良策 — SeunghyunSEO7 · 2026-07-29
- AI 药物发现流程已覆盖小分子和纳米抗体实验验证 — const_reborn · 2026-07-29
- Jon Durbin 用每小时不到 10 美元预训练 20B MoE — const_reborn · 2026-07-29
- 商业 LLM 预训练再多,为什么下棋还是不行 — alex_peys · 2026-07-29
- 微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍 — pmttyji · 2026-07-29