模型嫁接:把 Qwen3.5-4B 改造成因果编码器-解码器,长提示提速 3.7 倍

asankhs · reddit · 2026-09-22

Reddit 用户 asankhs 介绍了「模型嫁接」(Model Grafting):借鉴 DeepSeek-V4.1-Flash 的因果编码器-解码器架构(原版从头训练),对现有预训练模型进行事后改造——在某深度处切开,让低层读取提示词,通过 identity-init 适配器把上层作为编码器残差流的前缀 KV,再用未修改父模型做自蒸馏「愈合」,解码部分保持不变。

作者将该配方应用于 Qwen3.5-4B,发布了两个变体(Hugging Face: LocalLLM/Qwen3.5-4B-graft8 与 graft16):

方法详解见作者博客文章。这为无需从头训练即可加速长上下文推理提供了开源路径。

所属事件:模型嫁接把 Qwen3.5-4B 改成因果架构提速3.7倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →