DeepSeek V4 训练细节曝光:RL 训练超 10T token,上下文冲到 1M
stochasticchasm · x · 2026-09-11
网友 stochasticchasm 分析称,DeepSeek V4 成为继 MAI-thinking-1 之后第二个在「collapse 之后仍持续 RL 训练」的案例,并指出其做法颇为大胆:跨不同 scaffold 合并 checkpoint。
补充观察:训练全程没有出现不稳定,说明 v4 训练期已解决了相关问题,对这一架构是好信号;团队继续沿用 WSD 调度,并持续扩展上下文长度约 10T token——以 1M token 的上下文训练如此之久相当罕见。消息属社区分析,未经官方证实。
所属事件:DeepSeek V4 训练细节:超 10T token 与 1M 上下文(3 条相关)→
「模型」频道最新
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- Anthropic 发布最详细威胁情报报告,曝 Claude 遭滥用案例 — typewriters · 2026-09-11