Matryoshka 语言模型套件:嵌套架构省 36% 算力

willdepue · x · 2026-08-21

论文提出了一种新的“Matryoshka”语言模型训练框架,通过将 500M、1.5B 和 3B 三个模型嵌套在单一架构中进行端到端训练。该方法使小模型能免费从大模型获得知识蒸馏,共享权重和 KV Cache 以加速推测解码。实验表明,该套件性能与独立训练的基线相当,但减少了 36% 的训练算力,并将推测解码吞吐量提升了 14-26%。

所属事件:Matryoshka 嵌套语言模型套件:一次训练省 36% 算力(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →