疑似前沿模型架构细节:无RoPE与混合注意力
nrehiew_ · x · 2026-07-16
推文分析了疑似某前沿模型的架构细节。注意力机制方面:采用了滑动窗口,并在 KV 和残差连接上使用了 1D 卷积;完全弃用 RoPE,改为基于距离收集相对位置偏置。MoE 侧:总参数量 975B,激活参数 41B,训练使用了 45T 多模态 token;采用类似 DeepSeek v3 的架构,但包含 6 个路由专家和 2 个共享专家(通常为 1 或 0),提高了稀疏率。
所属事件:Inkling 表现与相关架构猜测升温(7 条相关)→
「研究」频道最新
- LagTag 染色质记录研究正式发表,AI 助力基因史追踪 — arjunrajlab · 2026-09-03
- SIGGRAPH Asia 2026 差旅资助开放申请,9 月 18 日截止 — tomaszbednarz · 2026-09-03
- 100 个已知错误实测 AI 同行评审:最强系统抓 71 个,多模型集成达 93 个 — alejandroll10 · 2026-09-03
- EMNLP 论文:从零预训练对比发现罗马化文本跨语言迁移最优 — TuhinChakr · 2026-09-03
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03