外挂小模型移植 DeepSeek 架构思路,Qwen3-8B prefill 提速近一倍

rickasaurus · x · 2026-09-14

有人把 DeepSeek V4.1 Flash 的 Causal Encoder-Decoder(后半层 KV 近似)思路移植到现有 Qwen3-8B 上:不修改模型权重,只额外训练一个近似小模块,根据前半层状态预测后半层所需 KV,跳过长提示词在全部 Transformer 层的重复计算。结果 prefill 时间缩短接近一半,输出保持一致。

为什么重要:本地部署(如 DGX Spark)最大的痛点往往不是生成速度,而是长上下文首次加载时等第一个 token 太久——系统提示词、工具定义、项目代码、检索文档一起塞入后,prefill 随上下文长度线性变重。

DeepSeek V4.1 Flash 原理:模型拆成前后二十层,前半层像 Causal Encoder 处理输入;生成阶段后半层做完整推理,但输入阶段用 Encoder 最终状态投影的共享 KV,只在 prefill 激活约 8B 参数(生成阶段约 16B),全局 KV 压到约每 token 890 字节。

启示:这种收益原本以为必须重新训练模型才能获得,现在证明可以外挂近似实现。若能在更多模型上稳定复现,Llama、Qwen、DeepSeek 蒸馏模型及各种微调过的垂直模型都无需等下一代发布,就能大幅优化本地 agent 的长上下文体验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →