Engram 检索架构省不了全部参数,但可砍 40-50% HBM 需求
bookwormengr · x · 2026-09-22
作者回应 @teortaxesTex 关于中国 DRAM 产能与 Engram 可扩展性的讨论,分析 Engram/n-gram 检索机制的本质:它不是计算系统,而是嵌入意义上的检索系统,在隐藏状态中加入 2-gram、3-gram 可省去大量重建语义的 FLOP 计算。
核心观点:
- Engram 不太可能完全替代 FFN/MoE(占模型 90% 参数),注意力计算和概念升维/降维仍不可少;DeepSeek 只做到约 40% 模型位宽、LongCat 也不超过 50% 参数
- 真正的收益不在替代参数,而在于省 40-50% HBM 存储之外,更重要的是省下更昂贵的 HBM 带宽
- 即使 FFN/MoE 无法被完全消除,减少近半 HBM 需求本身就是巨大的成本节约
所属事件:DeepSeek Engram 讨论:本质为语义检索,省 HBM 是关键(3 条相关)→
「Infra」频道最新
- python-build-standalone 为 CPython 3.12+ 启用全量 LTO 提升运行性能 — charliermarsh · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22
- 「AWS 让行业变软」:AI 基础设施还没有躺赢的资本 — mgill25 · 2026-09-22
- Grass 网络获第三方审计:3 亿带宽用户贡献 3210 万美元营收 — Ronangmi · 2026-09-22
- SemiAnalysis 深文:MoE 模型如何映射到推理硬件的算力与数据搬运 — zephyr_z9 · 2026-09-22