外挂小模型移植 DeepSeek 架构思路,Qwen3-8B prefill 提速近一倍
rickasaurus · x · 2026-09-14
有人把 DeepSeek V4.1 Flash 的 Causal Encoder-Decoder(后半层 KV 近似)思路移植到现有 Qwen3-8B 上:不修改模型权重,只额外训练一个近似小模块,根据前半层状态预测后半层所需 KV,跳过长提示词在全部 Transformer 层的重复计算。结果 prefill 时间缩短接近一半,输出保持一致。
为什么重要:本地部署(如 DGX Spark)最大的痛点往往不是生成速度,而是长上下文首次加载时等第一个 token 太久——系统提示词、工具定义、项目代码、检索文档一起塞入后,prefill 随上下文长度线性变重。
DeepSeek V4.1 Flash 原理:模型拆成前后二十层,前半层像 Causal Encoder 处理输入;生成阶段后半层做完整推理,但输入阶段用 Encoder 最终状态投影的共享 KV,只在 prefill 激活约 8B 参数(生成阶段约 16B),全局 KV 压到约每 token 890 字节。
启示:这种收益原本以为必须重新训练模型才能获得,现在证明可以外挂近似实现。若能在更多模型上稳定复现,Llama、Qwen、DeepSeek 蒸馏模型及各种微调过的垂直模型都无需等下一代发布,就能大幅优化本地 agent 的长上下文体验。
「Infra」频道最新
- Qwen3.8-27B NVFP4 量化横评:lm_head 精度决定 MTP 加速成色 — danielhanchen · 2026-09-14
- 马斯克:SpaceX 明年将在太空部署 Nvidia AI 计算机 — inductionheads · 2026-09-14
- AI 程序化生成 FlashAttention:CuTe 分块产出可运行 CUDA 代码 — vtabbott_ · 2026-09-14
- 小团队训练基建 Tahuna 开源:训练推理编排一站搞定 — Monaim101 · 2026-09-14
- Meta MTIA 400 芯片兼顾 LLM 训练与广告推荐推理 — jonathanmendez · 2026-09-14
- 业内人谈算力供给:用 Uber 模式理解 GPU 合同产能与渠道 — MatthewChang · 2026-09-14