DeepSeek V4 训练细节:超 10T token 与 1M 上下文

网友 stochasticchasm 分析 DeepSeek V4 与 k3 的训练细节:DeepSeek V4 成为继 MAI-thinking-1 之后第二个在「collapse 之后仍持续 RL 训练」的案例,训练量超 10T token、上下文长度达 1M,全程未出现失稳,推测稳定性问题已在新一轮训练中解决;模型继续沿用 WSD 学习率调度。k3 的 RL 训练则全程使用约 5000 万个沙盒,高峰达数百万并发,规模令人惊叹。

2026-09-11 ~ 2026-09-11 · 3 条相关