斯坦福推出开源分词器 Gigatoken

斯坦福 AI 实验室成员 Marcel Roed 推出了全新的开源分词器 Gigatoken,号称是目前世界上速度最快的分词器实现。该工具在数据预处理阶段展现出极高的吞吐能力,有望显著提升大规模语言模型的数据处理效率。

已确认

根据项目公布的基准测试数据,Gigatoken 的运行速度极其夸张。在大多数机器和分词器定义下,其速度比 Hugging Face 的分词工具快约 500 到 1000 倍,比 OpenAI 的 Tiktoken 快约 100 倍。测试数据显示,该分词器的吞吐量最高可达到 8.2 GB/s。这意味着在一台配备双路 AMD EPYC 处理器的服务器上,单机完成整套 Common Crawl 数据集的分词处理只需不到 7 个小时。

为什么重要

数据预处理是大模型训练流程中极其耗时且关键的一环。Gigatoken 将分词速度提升到 GB/s 级别,极大缩短了海量文本数据的处理时间,这将直接帮助研发团队降低算力成本并加速大语言模型的迭代周期。

背景信息

据斯坦福 AI 实验室介绍,该项目的作者 Marcel Roed 同时也是斯坦福课程 CS 336(LLMs from Scratch)的团队成员。

2026-07-22 ~ 2026-07-22 · 5 条相关

一手来源