Gigatoken tokenizer 跑到 8.2 GB/s,Common Crawl 不到 7 小时可分词
seanmcdonaldxyz · x · 2026-07-22
Gigatoken 的 tokenizer 吞吐被提到达到 8.2 GB/s,引用的基准声称:整套 Common Crawl 在一台机器上不到 7 小时就能完成分词。
- 该测试基于一台双路 AMD EPYC 服务器。
- 这说明预处理阶段的吞吐已经非常高,web 级数据摄取不再像过去那样容易成为瓶颈。
- 这条信息本质上是一次极端的基础设施/预处理性能展示,不是模型或产品发布。
所属事件:斯坦福团队推出极速分词器 Gigatoken(4 条相关)→
「Infra」频道最新
- 开源 World Monitor 把 500 多路新闻做成全球情报面板 — Roger_M_Taylor · 2026-07-22
- 开源 CLI 代理号称把 Claude Code token 用量砍掉 90% — Roger_M_Taylor · 2026-07-22
- B200 可用性归零后,GPU 供给再次收紧 — zephyr_z9 · 2026-07-22
- Poolside Laguna S 2.1 在 96GB 本地 GPU 机上跑到 256K 上下文 — _TheWolfOfWalmart_ · 2026-07-22
- Unsloth 推出 Laguna S 2.1 的 GGUF 量化版 — BoogerheadCult · 2026-07-22
- 核电或将影响 2028 年后 AI 基建,中美占 2050 容量大头 — tengyanAI · 2026-07-22