DeepSeek Engram 架构被 Qwen/Longcat 采用省显存

bookwormengr · x · 2026-09-02

关于推理优化的讨论指出,除了经典的激活重算(前向删除后向重算)外,DeepSeek 提出的 Engram 架构正被广泛采用。该架构允许将更大的 embedding 表托管在 LPDDR 中,从而减少 HBM 存储和参数量,降低 FLOPs。目前 Longcat 2 (1.6T) 和 Qwen-3-Next 已采纳此技术。结合线性注意力等能利用 SRAM 的创新,推理效率将大幅提升。

所属事件:算力换显存成 AI 推理优化新趋势(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →