Reddit 网友断言:DeepSeek Engram 只是下次架构革命的半程
SrijSriv211 · reddit · 2026-09-10
一位 Reddit 用户发文探讨继 attention 之后下一个重大架构突破的方向。作者回顾了 2017 年 attention 机制如何让模型学会对输入分配注意力、支撑起 in-context learning 与规模化能力。
对于近期引发热议的 DeepSeek Engram 机制,作者认为它能让更小的模型承载更多世界知识,但只会让模型「更有知识」而非「更聪明」,不足以与 attention 相提并论,更像是下一次突破的「上半场」。
作者押注的真正突破是:模型的大部分参数变为输入依赖(input-dependent),即用一组较小且固定的权重矩阵动态生成「快权重」(fast-weights)来实时生成 FFN 权重——他类比 attention 本身就是一层生成快权重的机制,只是输出仍进入固定权重的 FFN。若 FFN 权重也能按输入即时生成,模型可能更小、更聪明,甚至解锁当前架构下只有大模型才具备的能力。
「漫话AGI」频道最新
- 记者观察:Anthropic 是「泡泡中的泡泡」,鲜谈 AI 落地应用 — sebkrier · 2026-09-10
- 开发者观点:好模型在于知道自身边界,而非看起来聪明 — AryHHAry · 2026-09-10
- Marc Andreessen 炮轰 AI 末日论者:靠炒作灭世论刷声望 — beffjezos · 2026-09-10
- 「灭绝太可怕?那我们自己解数学题?」AI 风险争论的嘲讽金句 — Miles_Brundage · 2026-09-10
- 开发者质疑:AI 安全员认真对待灰蛊场景显思辨不严肃 — Darpinian · 2026-09-10
- 「为防中国 ASI 而交出控制权」引质疑:人类不会轻易放手 — astralmatrix · 2026-09-10