Matryoshka 嵌套语言模型套件:一次训练省 36% 算力
研究者提出 Matryoshka LM Suites:不再独立训练模型套件中的每个模型,而是将 500M、1.5B、3B 三个模型嵌套在单一架构中一次运行完成训练。据 @willdepue 转述,该方法可省约 36% 训练算力;据 @yoavartzi 与 @nthngdy 介绍,其在推理与训练两端均带来收益,是模型套件构建方式的一次值得关注的改变。
已确认
- 每个子模型将其输出馈送给对应下一个子模型的层堆栈;与以往工作不同,每个子模型可拥有独立可调的宽度和深度,为内存与计算占用提供巨大设计空间。
- 所有子模型在同一流程中训练,预训练期间可免费进行师生在线蒸馏,子模型之间对齐度更高。
- 推理时用较小的子模型作为草稿,对最大模型做推测解码;嵌套结构共享内存与激活值,摊薄草稿开销,解码速度比基线快 10-30%。
- 性能与用相同数据训练的标准套件持平,且持续优于 iso-FLOPs 套件(以总套件 FLOPs 衡量);对比 MatFormer,在尺寸-性能权衡上更优,尺寸灵活性更高,KV Cache 需求可变。
- 研究发现匹配 KV Cache 占用即可匹配性能水平。
为什么重要
- 一次训练产出整套尺寸可调的模型,直接降低套件的训练算力成本,便于按部署条件灵活选择模型大小。
- 嵌套共享内存与激活值使推测解码的草稿开销几乎被摊销,是低成本加速解码的新路径。
2026-08-19 ~ 2026-08-21 · 8 条相关
一手来源
- Matryoshka 套娃模型:子模型可调宽深 — nthngdy ·
- Matryoshka 语言模型套件:嵌套架构省 36% 算力 — willdepue ·
- Matryoshka 推理提速 10-30%,训练融合蒸馏 — nthngdy ·
- Matryoshka 嵌套模型:预训期免费蒸馏提升子模型对齐 — nthngdy · 2026-08-19
- Matryoshka 推理提速 10-30%,性能优于 MatFormer — nthngdy · 2026-08-19
- Matryoshka 性能持平标准模型,子模型宽度深度可调 — nthngdy · 2026-08-19
- 【源头】Matryoshka 套娃模型:子模型可调宽深 — nthngdy · 2026-08-19
- 【源头】Matryoshka 推理提速 10-30%,训练融合蒸馏 — nthngdy · 2026-08-19
- 研究显示匹配 KV Cache 占用即可匹配模型性能 — nthngdy · 2026-08-19
- 新论文:嵌套式模型套件训练,算力成本大幅降低 — yoavartzi · 2026-08-19
- 【源头】Matryoshka 语言模型套件:嵌套架构省 36% 算力 — willdepue · 2026-08-21