Model Grafting Converts Qwen3.5-4B into Causal Encoder-Decoder, 3.7x Faster
A Reddit user demonstrated 'Model Grafting,' retrofitting Qwen3.5-4B into a causal encoder-decoder architecture inspired by DeepSeek-V4.1-Flash, achieving up to 3.7x speedup on long prompts.
2026-09-22 ~ 2026-09-22 · 2 related posts
- Model grafting turns Qwen3.5-4B into a causal encoder-decoder, 3.7x faster at 128K prompts — asankhs · 2026-09-22
1 near-duplicate retellings: asankhs