Matryoshka 推理提速 10-30%,训练融合蒸馏
nthngdy · x · 2026-08-19
在推理时,该方法使用较小的子模型作为草稿,对最大模型进行推测解码。由于采用嵌套结构,内存和激活值被共享,从而摊销了草稿开销。这使解码速度比基线快 10-30%。在训练方面,所有子模型在同一过程中训练,可在预训练期间免费进行师生在线蒸馏,使子模型之间对齐更好。
所属事件:Matryoshka 嵌套语言模型套件:一次训练省 36% 算力(8 条相关)→
「Infra」频道最新
- Unsloth V3 版 Qwen 模型在双 AMD 卡上崩溃 — Equivalent-Ear-8016 · 2026-08-21
- 中港团队开源 Libra,智能体训练吞吐提升 3 倍 — jiqizhixin · 2026-08-21
- 开源 x402-cleanweb-agent:网页转 Markdown 省 80% Token — EstablishmentTough18 · 2026-08-21
- 预训练还有巨大优化空间,算力是唯一瓶颈 — zeeshanp_ · 2026-08-21
- 算力账本:宣称日处理 100T token 需要约 58 万张 GPU? — teortaxesTex · 2026-08-21
- 摩尔定律失效在即,非硅计算与新型架构将迎资本热潮 — MikePFrank · 2026-08-21