antirez 总结:encoder/decoder 共享 KV 架构让本地低显存场景也能极速大 prefill

antirez · x · 2026-09-11

antirez 总结 DeepSeek v4.1 Flash encoder/decoder 共享 KV cache 架构的额外收益:它不仅在 prefill(模型读取)阶段节省算力,还让本地低内存推理环境实现非常快的大 prefill。他补充指出全量驻留 decoder 会冲掉 experts 缓存,但新版 SSD 流式加载实现能很好隐藏加载延迟,几秒内即可补偿,问题不大;前提是设备有较好的切换速度。

所属事件:antirez 在 Mac 上本地跑 DeepSeek v4.1 Flash:SSD 流式与双机 RDMA 实测(10 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →