Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍
ariG23498 · x · 2026-09-30
Hugging Face 团队发布 tokenizers v1 并撰文详解重构。核心动机:随着模型变快、负载扩大,tokenization 从原来的非瓶颈变成可能让 GPU 空转等待 CPU 的短板——大规模训练、高并发推理、反复处理长输入时尤其明显。
要点:
- v1 相比 v0.23 在很多场景下快数十倍,重点是把 encode/decode 与扩展性都做到可度量
- 团队感谢 IBM、NVIDIA 与 ExecuTorch 团队的补丁贡献
- 重构大量吸收了开源生态(gigatoken、tiktoken、kitoken 等)的已验证思路
- 团队希望借此表明 tokenizers 值得社区参与贡献
对学 LLM 的人来说,文章也把 tokenization 作为入门切入点推荐。
「Infra」频道最新
- 量化 softmax 预训练 Transformer:K=16 时验证损失仅增 0.004 nats — illinois · 2026-09-30
- xLLM 训练推理基础设施全套开源,含 xattn 与 xBridges — HongyiWang10 · 2026-09-30
- 120 张 B300 跑自动内核研究循环,6 小时为 Kimi K3 提效 40% — bookwormengr · 2026-09-30
- Cerebras 宣布为 General Compute 提供全球最快推理服务 — beffjezos · 2026-09-30
- 亚洲输美空运货物 8% 是数据中心配件,每天 30 架全货机 — yacineMTB · 2026-09-30
- 2x 4060 8GB 跑 Gemma 26B:mradermacher 量化实现 75 tok/s — Spiritual_Impress_30 · 2026-09-30