prefill 仅 15 个融合 kernel:V4.1 推理栈细节与分钟级 SWA 缓存
nrehiew_ · x · 2026-09-11
nrehiew 总结该模型推理侧的关键设计:
- 大量融合 kernel:prefill 仅执行 15 个 kernel,decode 仅 11 个
- 借 SWA 降低 KV 缓存:SWA 缓存仅保留在每条 user/assistant 消息末尾,TTL 为分钟级、存于 DRAM
- 缓存被逐出时有 replay 方案,最大回放由参数 S 约束;encoder 侧有相应回放策略
后训练哲学上,作者认同社区观察:该团队已完全转向数据驱动,而非训练算法研究。
所属事件:DeepSeek V4.1 技术报告解读:RL 基建、沙箱与推理栈细节曝光(8 条相关)→
「Infra」频道最新
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11