康奈尔推Matryoshka框架,嵌套模型算力降36%
TheTuringPost · x · 2026-08-22
康奈尔大学研究人员提出 Matryoshka 训练框架,将多个模型(如 500M、1.5B、3B)嵌套在一起作为单一架构进行端到端训练。
核心机制与优势:
- 嵌套架构:大模型内部包含小模型,共享参数以减少总参数量。
- 高效蒸馏:训练过程中每一步都能低成本地将大模型能力蒸馏给所有子模型。
- 推理加速:非常适合投机解码,因为草稿模型直接包含在验证模型中。
实验结果:
- 在基准测试及域外困惑度上,该套件表现与独立训练的基线模型持平。
- 训练计算量减少 36%,投机解码吞吐量提升 14-26%。
所属事件:康奈尔推出 Matryoshka 框架训练算力降 36%(3 条相关)→
「Infra」频道最新
- Anthropic 招聘前 TPU 领军者,进军自研 AI 芯片 — Pablomiller · 2026-08-22
- 爆料称马斯克已与 ASML 达成协议,购买大量光刻机设备 — burhop · 2026-08-22
- UBS 预测 2028 年 AI 基建支出 4.1 万亿,忽视电力瓶颈 — Servola-Journal · 2026-08-22
- 民调:75% 美国人反对数据中心 — pstAsiatech · 2026-08-22
- 马斯克预警:AI 算力激增将导致电力供应吃紧 — BLUECOW009 · 2026-08-22
- 修复 MTP 头,Ornith1.5 35B 推理耗时降 33% — frankentriple · 2026-08-22