模型嫁接:把 Qwen3.5-4B 事后改造成因果 encoder-decoder,提速最高 3.7 倍
asankhs · reddit · 2026-09-22
Reddit 用户展示了「模型嫁接(Model Grafting)」:受 DeepSeek-V4.1-Flash 从头训练因果 encoder-decoder 架构的启发,对已有模型动手术——在某一层深度切开,让下层读 prompt,上层作为 encoder 的残差流,通过 identity 初始化的 adapter 以 prefix KV 形式注入,再用未修改的父模型做自蒸馏「愈合」,解码部分保持不变。方法详情见其博客。
作者用同一配方在 Qwen3.5-4B 上做出两个变体并发布在 HuggingFace:
- graft8:在 128K 长度 prompt 下处理提速约 3.7 倍,但有一定精度损失。
- graft16:精度非常接近父模型,prompt 处理提速约 2.0 倍。
这是社区对「不改预训练、事后改造架构换取长上下文效率」路线的一次可复现实践,两个变体均已开源。
「研究」频道最新
- 研究者提议:用 RL 教 AI 学会在恰当时机放弃 — sqcai · 2026-09-22
- Dinur 凭 2006 年 PCP 定理新证摘得哥德尔奖,两节课即可讲完 — willcb · 2026-09-22
- Nature 发表 Delphy:近实时贝叶斯系统发育学追踪疫情爆发 — burny_tech · 2026-09-22
- Google 杰出科学家 Milanfar 将在 UCSB 讲 AI 计算成像未来 — docmilanfar · 2026-09-22
- FLA 库 KDA fast path 被曝前缀输出泄漏未来门控,下版修复 — YouJiacheng · 2026-09-22
- Halvar Flake 演讲:计算机科学正从精确学科变成概率学科 — soumitrashukla9 · 2026-09-22