DeepSeek 新模型技术报告:KV Cache 较 DSV4-Flash 缩小 4 倍,训练更稳定
stochasticchasm · x · 2026-09-11
stochasticchasm 在读完 DeepSeek 新模型(V4.1 Flash)技术报告前的讨论中给出几个亮点:
- 基准成绩高得惊人
- 相比 DSV4-Flash,KV cache 缩小了 4 倍
- 打破了「V<N> = 新一轮预训练」的版本惯例,这在此前规整的版本节奏下很少见
- 新架构像是 V4 的简化版,官方称训练过程稳定得多
作者认为对这一新架构的坚持值得期待。
所属事件:DeepSeek 新模型技术报告:KV Cache 缩小 4 倍(3 条相关)→
「Infra」频道最新
- 云上全 AI 论破产:企业 AI 正回流本地与混合基础设施 — DavidLinthicum · 2026-09-11
- ThunderKittens 登上 Vera Rubin:NVFP4 GEMM 跑出 22 PFLOPS — togethercompute · 2026-09-11
- 开源 Go 网关:拦截 Agent 失控循环并按 run 归因 LLM 花费 — SnooCauliflowers2631 · 2026-09-11
- 2×RTX 3090 + 512GB DDR5 本地跑大模型,如何冲上 15 t/s? — levoniust · 2026-09-11
- 用远程 Agent 重建家庭实验室:工具与检查比 LLM 本身更关键 — HankYeomans · 2026-09-11
- 开源 LayerLens:按 token×层粒度剖析 LLM 推理耗时 — Dry_Mixture130 · 2026-09-11