康奈尔推出 Matryoshka 框架训练算力降 36%

康奈尔大学研究人员提出 Matryoshka 训练框架,将 500M、1.5B、3B 等一系列不同大小的模型作为单个嵌套架构进行端到端训练。该框架在大小模型间建立连接,使小模型输出适配大模型且无需新增参数,最终实现训练算力降低 36%,推测解码吞吐量最高提升 26%,同时不降低模型准确率。

2026-08-21 ~ 2026-08-22 · 3 条相关

另有 1 条近重复转述:TheTuringPost