DeepSeek Engram 架构被 Qwen/Longcat 采用省显存
bookwormengr · x · 2026-09-02
关于推理优化的讨论指出,除了经典的激活重算(前向删除后向重算)外,DeepSeek 提出的 Engram 架构正被广泛采用。该架构允许将更大的 embedding 表托管在 LPDDR 中,从而减少 HBM 存储和参数量,降低 FLOPs。目前 Longcat 2 (1.6T) 和 Qwen-3-Next 已采纳此技术。结合线性注意力等能利用 SRAM 的创新,推理效率将大幅提升。
所属事件:算力换显存成 AI 推理优化新趋势(3 条相关)→
「Infra」频道最新
- 为了 AI 视频生成换 AMD 显卡?实测 ROCm 进展 — iridescentblob · 2026-09-02
- HybridInfer:本地模型卡顿自动切换云端的智能路由 — simrankoulsm · 2026-09-02
- 循环 Transformer 谣言成真,或削弱 HBM 需求 — zephyr_z9 · 2026-09-02
- 买 GPU 跑本地模型是伪需求?算力账不如直接订 API — brandon_galang · 2026-09-02
- HybridInfer:本地模型优先推理,卡死自动回退云端的开源路由 — simrankoulsm · 2026-09-02
- 4000 块 GB200 抵达德州,供 TACC 学界最大超算训练开源模型 — AlexGDimakis · 2026-09-02