KV 压至 890 字节/token:DeepSeek V4.1 Flash 显存需求降 3.9 倍
teortaxesTex · x · 2026-09-10
博主分析 DeepSeek V4.1 Flash 的工程突破:KV cache 压缩到 890 字节/token,百万 token 不足 1GB,相比 V4-Flash HBM 需求再降 3.9 倍、SSD 需求降 8 倍,而且半年过去仍没有其他模型接近 V4 架构的 KV cache 效率。按 96GB 显存/950DT 的最低配置估算,可在华为集群上并行跑约 130 万个满预算 agent。作者称其毛利率超过 90%,认为这种效率提升在美国实验室会被称作「RSI(递归自我改进)」。
所属事件:DeepSeek V4.1 曝 552B 非对称激活架构(15 条相关)→
「Infra」频道最新
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- Nvidia 收购 Hugging Face 后,业界呼吁建设中立替代平台 — hargup13 · 2026-09-10
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10