Reddit 网友断言:DeepSeek Engram 只是下次架构革命的半程

SrijSriv211 · reddit · 2026-09-10

一位 Reddit 用户发文探讨继 attention 之后下一个重大架构突破的方向。作者回顾了 2017 年 attention 机制如何让模型学会对输入分配注意力、支撑起 in-context learning 与规模化能力。

对于近期引发热议的 DeepSeek Engram 机制,作者认为它能让更小的模型承载更多世界知识,但只会让模型「更有知识」而非「更聪明」,不足以与 attention 相提并论,更像是下一次突破的「上半场」。

作者押注的真正突破是:模型的大部分参数变为输入依赖(input-dependent),即用一组较小且固定的权重矩阵动态生成「快权重」(fast-weights)来实时生成 FFN 权重——他类比 attention 本身就是一层生成快权重的机制,只是输出仍进入固定权重的 FFN。若 FFN 权重也能按输入即时生成,模型可能更小、更聪明,甚至解锁当前架构下只有大模型才具备的能力。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →