Solar Open 2 预训练把 20T token 压到 10T,并扩到 1M 上下文
keunwoochoi · x · 2026-07-26
- 这条主要讲 Solar Open 2 的预训练流程:先从 Solar Open 1 做选择性权重迁移,再走大约 12T token 的三阶段训练。
- 数据侧从最初清洗过的 20T token 池进一步压缩到 10T,会给数据打质量分、去重,并调整混合比例,让真实数据、代码、数学和英语占比更高。
- 第 4 阶段把上下文扩到 1M tokens;作者还提到在长上下文扩展时性能有回落,因此通过 checkpoint merge 做了补偿。
所属事件:Solar Open 2 采用选择性权重迁移与高效预训练(2 条相关)→
「模型」频道最新
- 前沿实验室竞逐编码能力,模型正走向商品化 — willccbb · 2026-07-26
- 谷歌与英伟达高管公开力挺开放权重模型 — omarsar0 · 2026-07-26
- Grok 4.5 在 Augment Code 里周增幅登顶 — XFreeze · 2026-07-26
- Solar Open 2 已有量化版本,API 即将全面开放 — keunwoochoi · 2026-07-26
- Solar Open 2 扩到 250B,却把总训练 tokens 降了下来 — keunwoochoi · 2026-07-26
- Solar Open 2 采用 MoE、线性注意力和无位置编码 — keunwoochoi · 2026-07-26