DeepSeek V4 训练细节:超 10T token 与 1M 上下文
网友 stochasticchasm 分析 DeepSeek V4 与 k3 的训练细节:DeepSeek V4 成为继 MAI-thinking-1 之后第二个在「collapse 之后仍持续 RL 训练」的案例,训练量超 10T token、上下文长度达 1M,全程未出现失稳,推测稳定性问题已在新一轮训练中解决;模型继续沿用 WSD 学习率调度。k3 的 RL 训练则全程使用约 5000 万个沙盒,高峰达数百万并发,规模令人惊叹。
2026-09-11 ~ 2026-09-11 · 3 条相关
- 观察:v4 训练无失稳,1M 上下文撑约 10T token 训练量 — stochasticchasm · 2026-09-11
- DeepSeek V4 训练细节曝光:RL 训练超 10T token,上下文冲到 1M — stochasticchasm · 2026-09-11
- k3训练曝光:全程约5000万沙盒,高峰数百万并发 — stochasticchasm · 2026-09-11