为什么tokenizer优化如此困难?预训练昂贵且反馈周期长

paul_cal · x · 2026-07-29

作者分析了文本token表示尚未被超优化的两个主要原因:1)预训练极其缓慢且昂贵,OpenAI自GPT-3以来仅进行了少数几次预训练并发布下游模型;且tokenizer的缺陷只有在规模下才显现,反馈周期极长。2)tokenizer设计不易端到端梯度下降优化,它是符号程序,无法与语言建模任务联合学习。tokenizer是transformer的稳定基础,改变它会影响输入输出空间,且复杂化会引入额外成本。

所属事件:预训练成本高昂致使tokenizer难以彻底优化(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →