为何 tokenizers 仍难被端到端优化
seanmcdonaldxyz · x · 2026-07-29
Paul Cal 认为,文本 token 表示之所以还没有被“极致优化”,根本原因是 预训练太慢、太贵:前沿模型训练机会很少,而一个 tokenizer 好不好,往往要到大规模使用后才看得出来。
他给出的关键理由包括:
- tokenizer 本质上是 符号程序,不是像 embedding 那样可以直接在训练中顺滑学习的参数。
- 它决定了模型的 输出目标 和表示空间的形状,后续再回头改 tokenizer 非常困难。
- 复杂 tokenizer 若想端到端优化,可能又会变成一层昂贵的“第二个模型”,失去当前 CPU 上轻量运行的优势。
- 因此,目前还没有一个被广泛接受、且足够前沿可用的端到端 tokenizer 优化方案,能同时做到 更少 token 和 不损失效果。
这条更像对 tokenizer 设计瓶颈的一次系统性解释,而不是单点结论。
所属事件:预训练成本高昂致使tokenizer难以彻底优化(2 条相关)→
「研究」频道最新
- 前 Meta 研究员创业,做面向物理世界的可解释 AI — soniajoseph_ · 2026-07-29
- World Labs 强调机器人最关键指标是仿真到真实成功率 — andrew_n_carr · 2026-07-29
- 交互式戒指做 AI 交互,触觉输出可能比语音更重要 — plopesresearch · 2026-07-29
- 普林斯顿300页论文梳理强化学习如何走向世界模型 — udmrzn · 2026-07-29
- PostTrainBench v1.1 标记 234 次污染运行并强化反作弊 — scaling01 · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29