DeepSeek V4 训练细节曝光:RL 训练超 10T token,上下文冲到 1M

stochasticchasm · x · 2026-09-11

网友 stochasticchasm 分析称,DeepSeek V4 成为继 MAI-thinking-1 之后第二个在「collapse 之后仍持续 RL 训练」的案例,并指出其做法颇为大胆:跨不同 scaffold 合并 checkpoint。

补充观察:训练全程没有出现不稳定,说明 v4 训练期已解决了相关问题,对这一架构是好信号;团队继续沿用 WSD 调度,并持续扩展上下文长度约 10T token——以 1M token 的上下文训练如此之久相当罕见。消息属社区分析,未经官方证实。

所属事件:DeepSeek V4 训练细节:超 10T token 与 1M 上下文(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →