SemiAnalysis 拆解 DeepSeek V4.1 Flash:Engram 查表换 1.6 倍性价比
teortaxesTex · x · 2026-09-26
被引用的帖文与 SemiAnalysis 数据称,DeepSeek V4.1 Flash 的 Engram 记忆层把常见词组变成查找表,从 GPU 中移走「背课文」式计算(未经官方证实,作者也在质疑其真实增益):
- 每层仅激活约 80 亿(输入)/160 亿(输出)参数,其余约 1960 亿为查找表;浅层记物体、深层记关系
- 表只依赖 token ID,可放入主机内存;B300 上 TP4 降到 TP2,性价比最高提升约 1.6 倍
- 4 张 GB300 把表卸载到主机后,KV 容量还能再增约 36%
- B200 上内存卸载优于 SSD:同等体验下每美元总 token 约 1.21 亿 vs 5200 万
- 双机 GB300 预填充约 5.6 万 token/秒,单用户解码约 253 token/秒
结论:便宜来自少算、少占 HBM;强来自该查就查、该算就算——显存带宽比容量更值钱。评论者则提醒:便宜不等于建模能力有增益,大家是否只是「信任 DeepSeek」值得追问。
「Infra」频道最新
- Anthropic 与 OpenAI 标价相同但缓存读取价差 4 倍,价目表不等于真实价格 — julsimon · 2026-09-26
- ASML 财报:EMMEA 销售占比从 4.7% 跌至零,欧洲在建 2015 年制程芯片 — julsimon · 2026-09-26
- Glamsterdam 升级将用状态快照取代修复阶段,节点同步再提速 — banteg · 2026-09-26
- 20 万卡 GB300 集群只有 10% MFU?社区热议 xAI 算力效率 — teortaxesTex · 2026-09-26
- 英伟达市值 5.4 万亿美元,超过英法德任一国股市总市值 — iamfakhrealam · 2026-09-26
- 三个月精选论文清单:LLM 分布式训练与推理入门路径 — East-Muffin-6472 · 2026-09-26