SentencePiece Lite 发布:50KB 二进制,tokenization 快 20-30 倍
heiga_zen · x · 2026-09-16
SentencePiece 作者 Taku Kudo 发布 SentencePiece Lite Runtime,一个面向资源受限场景的极简分词运行时,官方称它是下一代核心引擎。
关键数据与设计:
- 约 50KB 二进制、不到 2000 行 C++,零依赖(仅 FlatBuffers + C++20),可直接链接进移动 App、iOS/Android SDK 和嵌入式设备
- 直接读取内存映射的 FlatBuffers 模型文件(.spm.fb),实现零拷贝启动,吞吐量比原版快 20-30 倍,堆内存分配大幅减少,支持 zero-heap 运行
- 功能上保留 Unigram 与 BPE、文本归一化、byte fallback、原始字节偏移追踪、随机子词采样(Gumbel/BPE Dropout)与安全边界预切分,结果与原版 100% 兼容
- 提供单文件 .cc 整合发行,便于集成;未来将成为 SentencePiece 的默认运行时核心
对做端侧/边缘部署推理栈的工程师来说,这是一个显著降低 tokenization 开销的新选项。
「Infra」频道最新
- 当模型能力趋同,大模型工作只剩两件事:数据和基础设施 — saurabh_shah2 · 2026-09-16
- 华为内部万字备忘录泄露:押注昇腾950替代英伟达,不做基础模型 — pstAsiatech · 2026-09-16
- 豆包手机预约破 36 万台,RTX 5090 第三方炒至 9500 美元 — 创业邦 · 2026-09-16
- Qwen 27B 与 DeepSeek v4 Flash 同机异构运行,展示 GPU+统一内存方案 — samsja19 · 2026-09-16
- JPMorgan 预测 2028 年 GPU/ASIC 出货超 2500 万,ASIC 主导增长 — bookwormengr · 2026-09-16
- iamtrask:终局不是单个 AGI,而是人人运行小型 LLM 的信任网络 — iamtrask · 2026-09-16