Model Grafting Converts Qwen3.5-4B into Causal Encoder-Decoder, 3.7x Faster

A Reddit user demonstrated 'Model Grafting,' retrofitting Qwen3.5-4B into a causal encoder-decoder architecture inspired by DeepSeek-V4.1-Flash, achieving up to 3.7x speedup on long prompts.

2026-09-22 ~ 2026-09-22 · 2 related posts

1 near-duplicate retellings: asankhs