新模型架构极简:SWA+无共享专家 MoE,与 DeepSeek 路线迥异

nrehiew_ · x · 2026-09-23

nrehiew 点评一份新模型技术报告:其架构出乎意料地简单保守,仅用滑动窗口注意力(SWA)和无共享专家的标准 MoE,与 DeepSeek 的复杂设计形成鲜明对比。他认为真正有意思的地方在数据与实验部分,架构细节反而被略过。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →