康奈尔推出 Matryoshka 框架训练算力降 36%
康奈尔大学研究人员提出 Matryoshka 训练框架,将 500M、1.5B、3B 等一系列不同大小的模型作为单个嵌套架构进行端到端训练。该框架在大小模型间建立连接,使小模型输出适配大模型且无需新增参数,最终实现训练算力降低 36%,推测解码吞吐量最高提升 26%,同时不降低模型准确率。
2026-08-21 ~ 2026-08-22 · 3 条相关
- 康奈尔新架构降低 36% 训练算力 — burkov · 2026-08-21
- Matryoshka 框架:一次训练全家模型,算力降 36% — TheTuringPost · 2026-08-22
另有 1 条近重复转述:TheTuringPost