Meta 论文挑战分词器默认:字节模型训练足够后反超 Token 模型
alex_verem · x · 2026-10-10
Meta FAIR 与华盛顿大学的新论文质疑了整个行业依赖分词器(tokenizer)的默认假设:小型模型直接读原始字节(词表约 256)能否打赢 token 模型?答案是训练足够久后不仅能追平还能反超。
- 用 Llama 3-8B 作为教师蒸馏出字节学生模型,总参数 1.28B,少于 token 版学生的 1.81B,仍然胜出
- 字节模型用约 1/6 的训练数据即可达到 token 模型的同等精度,教师训练数据存储降到约 1/5
- 缩放律外推显示字节模型在六个基准上平均可高出约 4%,超过 Llama 3.2-1B 和 Gemma-3-1B-pt
- 关键技巧是每 4.5 字节插入一个小标记,标示 token 边界,代价是每份数据约多 31% 计算量
结论:被当成必需品的 tokenizer,可能只是习惯而非必然。
所属事件:Meta 新论文:字节模型经充分训练与蒸馏可反超 token 模型(2 条相关)→
「模型」频道最新
- 用户实测 Haiku 不懂交易:分不清 bids 和 offers 的基本概念 — arthurcolle · 2026-10-10
- 第三方实测:阶跃 Step 5 Preview 无需改码生成可用数据看板 — StepFun_ai · 2026-10-10
- HiDream-O1-Video-1.0 登顶图生视频榜第 6,1080p 带同步音频 — ArtificialAnlys · 2026-10-10
- 博主推测:Anthropic 半年前内部已有 Opus 5.5 级智能 — yihui_indie · 2026-10-10
- Nace AI 10B 以下决策模型 Drex v1.5 上架 OpenRouter — nischay_twt · 2026-10-10
- Claude Opus 4.6 贷款案例:真实环境中的顽固错配样本 — rgblong · 2026-10-10