Solar Open 2 采用 MoE、线性注意力和无位置编码
keunwoochoi · x · 2026-07-26
- 这条是给 LLM 架构党看的 Solar Open 2 技术拆解,主打 250B 主权模型的设计细节。
- 图里显示它是一个 48 层 堆栈,重复四层模式:1 层 softmax attention + 3 层 linear attention,每层都配 MoE 模块。
- 关键点还包括:320 个 routed experts、1 个 shared expert、没有位置编码,以及在线性注意力核心里引入 negative-eigenvalue 扩展来改善状态跟踪。
所属事件:Solar Open 2 采用 MoE 与线性注意力等创新架构(2 条相关)→
「模型」频道最新
- Reddit 讨论 5.6 Sol 是否还保留 Pro 专属模型层 — Massive_Sherbert_152 · 2026-07-26
- 前沿实验室竞逐编码能力,模型正走向商品化 — willccbb · 2026-07-26
- 谷歌与英伟达高管公开力挺开放权重模型 — omarsar0 · 2026-07-26
- Grok 4.5 在 Augment Code 里周增幅登顶 — XFreeze · 2026-07-26
- Solar Open 2 已有量化版本,API 即将全面开放 — keunwoochoi · 2026-07-26
- Solar Open 2 扩到 250B,却把总训练 tokens 降了下来 — keunwoochoi · 2026-07-26