Matryoshka 框架:一次训练全家模型,算力降 36%

TheTuringPost · x · 2026-08-22

康奈尔研究人员提出了 Matryoshka 训练策略,允许将一系列模型作为单个嵌套模型进行训练。该框架在大小模型间建立连接,使小模型输出适配大模型,无需新增参数。这种方法实现了两个优势:内置的蒸馏效果(小模型自动学习大模型)以及加速推测解码。相比单独训练,该方法在保持同等质量下,减少了 36% 的训练算力,并使推测解码速度提升了 14–26%。

所属事件:康奈尔推出 Matryoshka 框架训练算力降 36%(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →