Upstage 发布 250B 主权大模型 Solar Open 2
Upstage 发布的 250B 主权大模型 Solar Open 2 技术报告引起热议。该模型在体量比上代扩大 2.5 倍的情况下,反而缩减了总训练 token,并凭借创新的架构设计与数据策略,在韩国本土基准测试中取得了领先成绩。
已确认
架构设计:Solar Open 2 总计 48 层,采用混合模式(1 层 softmax attention + 3 层 linear attention),使用了混合专家与无位置编码技术,并支持 1M 上下文长度。
预训练与权重迁移:预训练数据从初始清洗的 20T token 池压缩至 10T,经历了约 12T token 的三阶段训练。模型从 Solar Open 1 中选择性迁移了 5.69B 兼容参数,不兼容的新模块(如专家层)则进行重新初始化与训练。
基准表现:在韩国任务基准测试中,Solar Open 2 在六个对比模型中脱颖而出,以 85.4 的最高平均分领先于 DeepSeek-V4 等模型,并能处理真实的监管文档示例。
为什么重要
Solar Open 2 展示了一种高效的大模型迭代范式:通过选择性权重迁移和混合注意力架构,在不盲目增加训练数据量的情况下,成功扩大了模型参数规模。此外,它在韩语等本土任务上的卓越表现,为主权大语言模型的实用化提供了极具参考价值的案例。
2026-07-26 ~ 2026-07-26 · 6 条相关
一手来源
- Solar Open 2 250B 技术报告被做成要点版 — keunwoochoi ·
- 【源头】Solar Open 2 250B 技术报告被做成要点版 — keunwoochoi · 2026-07-26
- Solar Open 2 采用 MoE、线性注意力和无位置编码 — keunwoochoi · 2026-07-26
- Solar Open 2 从 1 代复用 5.69B 权重,再重训专家层 — keunwoochoi · 2026-07-26
- Solar Open 2 预训练把 20T token 压到 10T,并扩到 1M 上下文 — keunwoochoi · 2026-07-26
- Solar Open 2 扩到 250B,却把总训练 tokens 降了下来 — keunwoochoi · 2026-07-26
- Solar Open 2 在韩国基准上以 85.4 平均分领跑 — keunwoochoi · 2026-07-26