AI2 Nature 论文:用「字节化」蒸馏改造主流 LLM,预算不到预训练 1%
TheTuringPost · x · 2026-10-09
Allen AI 在 Nature 发表新论文,提出无需从零烧钱预训练、把现有模型改造成字节级模型的方法「byteification」(字节化):
- 两阶段蒸馏:对 Olmo、Llama 3、Qwen 等预训练模型做改造,成本不到原预训练预算的 1%,免去字节级模型从零训练的巨额开销。
- 关键架构洞察:subword 分词器划界时会「偷看」未来字节,而传统字节级 patch 预测器是严格因果的;解法是在 prefill 时加 1 字节前瞻、decode 时预测融合的边界 token,弥合表达力差距。
- 成果:改造出的 Bolmo、Blama、Bwen 推理速度实用,在字符级推理任务上碾压标准分词模型,还能用简单的 task arithmetic 迁移指令微调。
对做 token-free 架构的人是必读工作。
「模型」频道最新
- Open-EmbeddingGemma 收尾:作者谈为何坚持开源复现闭源模型 — KyeGomezB · 2026-10-10
- 开源复现 Google 740M 多模态嵌入模型 EmbeddingGemma 2 — KyeGomezB · 2026-10-10
- Open-EmbeddingGemma 复现依据:HuggingFace 参数与官方发布材料 — KyeGomezB · 2026-10-10
- 一文看懂 EmbeddingGemma 2:六步把五模态压进 768 维向量 — KyeGomezB · 2026-10-10
- 开发者实测:Gemini 3.8 Flash 做传统 RAG 胜过 Opus 5.5 — rickasaurus · 2026-10-10
- 实测四款前沿图像编辑模型连改30次:Ideogram 4.5 最稳,GPT Image 漂移最明显 — ArtificialAnlys · 2026-10-10