antirez 总结:encoder/decoder 共享 KV 架构让本地低显存场景也能极速大 prefill
antirez · x · 2026-09-11
antirez 总结 DeepSeek v4.1 Flash encoder/decoder 共享 KV cache 架构的额外收益:它不仅在 prefill(模型读取)阶段节省算力,还让本地低内存推理环境实现非常快的大 prefill。他补充指出全量驻留 decoder 会冲掉 experts 缓存,但新版 SSD 流式加载实现能很好隐藏加载延迟,几秒内即可补偿,问题不大;前提是设备有较好的切换速度。
所属事件:antirez 在 Mac 上本地跑 DeepSeek v4.1 Flash:SSD 流式与双机 RDMA 实测(10 条相关)→
「Infra」频道最新
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 预算友好多 GPU 本地 LLM 搭建实录:写给新人的入门指南 — lblblllb · 2026-09-11
- 腾讯参投的燧原科技上海上市首日暴涨 179%,募资 9.1 亿美元 — pstAsiatech · 2026-09-11
- Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开 — whiteh4cker · 2026-09-11
- Qdrant 宣布三场免费社区活动:4 小时向量技术长直播压轴 — qdrant_engine · 2026-09-11
- 国内 B300 现货喊到 1600 万一台,3 倍溢价把国产卡推成推理最优解 — aigclink · 2026-09-11