Rust 分词器并行吞吐达 8.27 GB/s,远超 HF tokenizers
deliprao · x · 2026-07-25
在一台 Apple M4 Max 上的基准测试显示,并行场景里 tokenizer 吞吐差距非常大。
- Gigatoken(Rust 优化)在 GPT-2 分词、12GB 数据集上达到 8.27 GB/s。
- tiktoken 为 61.5 MB/s。
- HF tokenizers 只有 6.2 MB/s。
这条帖子的核心结论是:当并行吞吐是关键指标时,Rust 路线的 tokenizer 可能比 Python/Hugging Face 方案快出几个数量级。
「Infra」频道最新
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- QuixiCore 主张原生量化内核取代先反量化再执行 — QuixiAI · 2026-07-27
- Nvidia 被曝洽谈为 OpenAI 俄亥俄数据中心提供 2500 亿美元背书 — Wonderful_Buffalo_32 · 2026-07-27