斯坦福推出开源分词器 Gigatoken
斯坦福 AI 实验室成员 Marcel Roed 推出了全新的开源分词器 Gigatoken,号称是目前世界上速度最快的分词器实现。该工具在数据预处理阶段展现出极高的吞吐能力,有望显著提升大规模语言模型的数据处理效率。
已确认
根据项目公布的基准测试数据,Gigatoken 的运行速度极其夸张。在大多数机器和分词器定义下,其速度比 Hugging Face 的分词工具快约 500 到 1000 倍,比 OpenAI 的 Tiktoken 快约 100 倍。测试数据显示,该分词器的吞吐量最高可达到 8.2 GB/s。这意味着在一台配备双路 AMD EPYC 处理器的服务器上,单机完成整套 Common Crawl 数据集的分词处理只需不到 7 个小时。
为什么重要
数据预处理是大模型训练流程中极其耗时且关键的一环。Gigatoken 将分词速度提升到 GB/s 级别,极大缩短了海量文本数据的处理时间,这将直接帮助研发团队降低算力成本并加速大语言模型的迭代周期。
背景信息
据斯坦福 AI 实验室介绍,该项目的作者 Marcel Roed 同时也是斯坦福课程 CS 336(LLMs from Scratch)的团队成员。
2026-07-22 ~ 2026-07-22 · 5 条相关
一手来源
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab ·
- Gigatoken tokenizer 跑到 8.2 GB/s,Common Crawl 不到 7 小时可分词 — seanmcdonaldxyz ·
- 【源头】斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Stanford AI Lab 介绍了一份号称最快的 tokenizer 实现 — StanfordAILab · 2026-07-22
- Gigatoken:比 Tiktoken 快百倍的开源分词器 — Thrumpwart · 2026-07-22
- 【源头】Gigatoken tokenizer 跑到 8.2 GB/s,Common Crawl 不到 7 小时可分词 — seanmcdonaldxyz · 2026-07-22
- Gigatoken 号称比 Hugging Face 分词器快 500 到 1000 倍 — ZainHasan6 · 2026-07-22