模型嫁接:把 Qwen3.5-4B 改造成因果编码器-解码器,长提示提速 3.7 倍
asankhs · reddit · 2026-09-22
Reddit 用户 asankhs 介绍了「模型嫁接」(Model Grafting):借鉴 DeepSeek-V4.1-Flash 的因果编码器-解码器架构(原版从头训练),对现有预训练模型进行事后改造——在某深度处切开,让低层读取提示词,通过 identity-init 适配器把上层作为编码器残差流的前缀 KV,再用未修改父模型做自蒸馏「愈合」,解码部分保持不变。
作者将该配方应用于 Qwen3.5-4B,发布了两个变体(Hugging Face: LocalLLM/Qwen3.5-4B-graft8 与 graft16):
- graft8:128K 长提示下处理速度约 3.7 倍,有一定精度损失
- graft16:约 2 倍提示处理加速,精度损失极小,更接近父模型
方法详解见作者博客文章。这为无需从头训练即可加速长上下文推理提供了开源路径。
所属事件:模型嫁接把 Qwen3.5-4B 改成因果架构提速3.7倍(2 条相关)→
「模型」频道最新
- DeepMind内部模型攻克百余个数学领域长期悬而未决的难题 — S_OhEigeartaigh · 2026-09-22
- 重磅RL报告发布:附9B蒸馏模型,7000个RL环境将开源 — tokenbender · 2026-09-22
- RL训练稳态秘诀:GRPO改造四板斧拆解 — tokenbender · 2026-09-22
- ChatGPT 研究员推出 Jev:比 LLM 快 200 倍、便宜 400 倍做决策 — bibryam · 2026-09-22
- Anthropic 披露 APT29 借 AI 发动网络间谍战的时间线 — jcran · 2026-09-22
- 开发者质疑 Prime Intellect 直播 RL 训练的真实性 — giffmana · 2026-09-22