Matryoshka 论文:嵌套训练模型套件省 36% 算力,投机解码提速 26%
yoavartzi · x · 2026-09-25
Yoav Artzi 转发自己与 Nathan Godey 的新论文 Matryoshka Language Model Suites(arXiv:2608.09703),并顺带吐槽审稿人只看 perplexity 数字、要求更多算力的现象。
论文要点:
- 传统上训练模型套件需要分别训练、独立部署每个模型。该框架将从小到大的多个子模型嵌套堆叠进单一架构,端到端联合训练。
- 训练中每一步即可从最大模型向所有小模型做低成本蒸馏;draft 模型内含于 verifier 之中,天然适合投机解码。
- 实证:训练包含 500M/1.5B/3B 子模型的套件,benchmark 与验证/域外 perplexity 与独立训练基线持平,但训练算力省 36%,投机解码吞吐提升 14-26%。
- 附关键架构选择的消融实验,为构建 Matryoshka 套件提供指导。
所属事件:Matryoshka 嵌套模型套件省36%算力,作者反讽审稿机制(2 条相关)→
「Infra」频道最新
- AI 能源公司 Parallax 出炉,获 Founders Fund 领投 1.17 亿美元 — graceisford · 2026-09-25
- Google 启动 Project Suncatcher:TPU 集群上太空组 ML 基础设施 — rseroter · 2026-09-25
- Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍 — AccBalanced · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25
- 音乐模型 YuE2 完整版被压到 1.7GB 内存跑上 iPhone — Acceptable-Cycle4645 · 2026-09-25
- 微软 Fabric Efficient Scaledown 让 Shuffle 重型任务成本降 43% — adnan_hashmi · 2026-09-25