疑似前沿模型架构细节:无RoPE与混合注意力

nrehiew_ · x · 2026-07-16

推文分析了疑似某前沿模型的架构细节。注意力机制方面:采用了滑动窗口,并在 KV 和残差连接上使用了 1D 卷积;完全弃用 RoPE,改为基于距离收集相对位置偏置。MoE 侧:总参数量 975B,激活参数 41B,训练使用了 45T 多模态 token;采用类似 DeepSeek v3 的架构,但包含 6 个路由专家和 2 个共享专家(通常为 1 或 0),提高了稀疏率。

所属事件:Inkling 表现与相关架构猜测升温(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →