Tokenizers 重构转向 SIMD,号称快 500 到 1000 倍
vanstriendaniel · x · 2026-07-22
Tokenizers 转向 SIMD 重构,v1 即将发布
帖子称团队正在把 tokenizer 的预分词和归一化阶段改成 SIMD,同时重做 BPE、WordPiece 等核心结构,目标是全面提速,并表示 Tokenizers v1 很快会到来。
引用内容里还提到 Gigatoken 的性能数据:在大多数机器上、针对多数 tokenizer 定义,它号称比 HuggingFace 方案快约 500–1000 倍,也比 OpenAI 的 tiktoken 快约 100 倍。
「Infra」频道最新
- Unsloth 号称单张 4090 就能微调 7B 模型 — thisdudelikesAI · 2026-07-22
- 开放权重模型或推高硬件需求,因为它们解锁了新工作负载 — bookwormengr · 2026-07-22
- 中文模型已不稀奇,2026 代国产算力集群才是大新闻 — teortaxesTex · 2026-07-22
- Mark Cuban 预言不少 AI 数据中心可能改成球场 — 2C_ornot2C · 2026-07-22
- LLM 推理基准在真实流量前往往会误导团队 — Suspicious_Orchid770 · 2026-07-22
- Cloudflare 式基础设施让 agent-first 应用更容易搭建 — threepointone · 2026-07-22