DeepSeek V4.1 技术报告解读:KV 压缩与推理努力参数引热议
研究员 nrehiew 于 09-11 连发多条帖子解读 DeepSeek V4.1 技术报告,称新模型跑分「离谱」,效率直逼 Sol/Opus 水平,并认为整体架构比 v4 的 HSA+CSA 组合更干净。这组解读覆盖训练基建、数据策略、推理栈与架构设计,博主 stochasticchasm 随后补充分析了其推理努力控制方案,是理解该报告的一手技术拆解。
已确认
- 推理优先架构:nrehiew 认为架构明显以推理优先,因 RL 模糊了训练与推理的边界;KV 缓存压缩惊人,仅 890 字节/token。
- RL 训练基建:精心的 dispatch 策略消除长尾停顿;从旧 checkpoint 做 router replay;针对短补全在训练早期造成 off-policy 的问题,在数据集层面设上限;使用 40+ 教师 OPD。
- 沙箱与数据策略:自研 orchestrator 在计算节点间放置沙箱并本地检查容量瓶颈,NUMA 域内每个 VM 支持单节点 2500 个并发沙箱,同机任务按优先级调度;agent 轨迹首次明确由真实合作伙伴使用模式启发,通过系统中多个 agent 合成生成,后训练以数据驱动为主,辅以 checkpoint 合并。
- 推理栈设计:大量融合 kernel,prefill 仅执行 15 个 kernel、decode 仅 11 个;借助 SWA 降低 KV 缓存,SWA 缓存仅保留在每条 user/assistant 轮次内,分钟级有效;V4.1 是他见过的首个拥有数值化 reasoning effort 参数的模型,该参数直接影响长度惩罚,用户可数值调节推理深度与输出简洁度的权衡。
- 推理努力控制方案:stochasticchasm 分析了这种新颖的 reasoning effort 控制方案,认为其与 OpenAI 的 juice 值思路相似,可实现更细粒度的控制;其训练设置的关键在于 GRPO 的用法——每个组在单一 effort 设置下训练。
- 推理曲线与 Agent 协作:推理性能曲线并非完全线性,原因存疑;他提到 FrontierCode 曾有代码质量惩罚项影响 Opus 5 xhigh,但这三个基准似乎没有类似惩罚;Agent 团队(swarm)模式通过 RL 显式训练协作。
尚未确认
- 推理能力曲线非线性的具体原因尚不明确,nrehiew 表示存疑。
为什么重要
这组解读显示 DeepSeek 在 RL 基建、智能体轨迹数据合成与推理栈工程化上的系统性投入,且数值化 reasoning effort 参数与 890 字节/token 的 KV 压缩若属实,将显著影响长上下文推理的成本与可控性;分级 GRPO 训练思路也为业界提供了可借鉴的推理努力调节方案。
2026-09-11 ~ 2026-09-11 · 9 条相关
一手来源
- DeepSeek 新技术报告解读:KV 仅 890 字节/token,为推理而生 — nrehiew_ ·
- DeepSeek V4.1 Flash 后训练全靠数据:合成多智能体轨迹加 checkpoint 合并 — nrehiew_ ·
- 首个推理努力参数直接影响长度惩罚的模型?V4.1 设计引关注 — nrehiew_ ·
- 【源头】DeepSeek V4.1 Flash 后训练全靠数据:合成多智能体轨迹加 checkpoint 合并 — nrehiew_ · 2026-09-11
- prefill 仅 15 个融合 kernel:V4.1 推理栈细节与分钟级 SWA 缓存 — nrehiew_ · 2026-09-11
- 单节点 2500 并发沙箱:智能体轨迹数据首次显式仿真实使用模式 — nrehiew_ · 2026-09-11
- 【源头】首个推理努力参数直接影响长度惩罚的模型?V4.1 设计引关注 — nrehiew_ · 2026-09-11
- RL 训练基建拆解:router replay、off-policy 控制与 40+ 教师 OPD — nrehiew_ · 2026-09-11
- 新模型跑分「离谱」:效率直逼 Sol/Opus 水平,RL 基建细节曝光 — nrehiew_ · 2026-09-11
- V4.1 推理能力曲线非线性,Agent 团队模式用 RL 显式训练协作 — nrehiew_ · 2026-09-11
- 【源头】DeepSeek 新技术报告解读:KV 仅 890 字节/token,为推理而生 — nrehiew_ · 2026-09-11
- 新型推理努力控制方案曝光:分级 GRPO 训练引热议 — stochasticchasm · 2026-09-11