Matryoshka 推理提速 10-30%,训练融合蒸馏

nthngdy · x · 2026-08-19

在推理时,该方法使用较小的子模型作为草稿,对最大模型进行推测解码。由于采用嵌套结构,内存和激活值被共享,从而摊销了草稿开销。这使解码速度比基线快 10-30%。在训练方面,所有子模型在同一过程中训练,可在预训练期间免费进行师生在线蒸馏,使子模型之间对齐更好。

所属事件:Matryoshka 嵌套语言模型套件:一次训练省 36% 算力(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →